Lepsze systemy QA (pytań i odpowiedzi) po polsku - Piotr Rybak
Rozmowa z Piotrem Rybakiem - NLP researcherem w PAN w Instytucie Podstaw InformatykiRozmawiamy min.:- najlepszych praktykach w budowaniu systemów typu "Retrieval"- jak trenować modele do tworzenia embeddingów - o budowie datasetów, tłumaczeniu angielskich i scrapowaniu- o tym czy LLMy mogą ukrywać przed nami swoją świadomość- czy proste rzeczy są naprawdę proste i czy są łatwe do zrozumienia- o różnicach w wiedzy na temat polskich i angielskich QnA - modelach Silver Retriever, - datasetach MAUPQA i POLQA- aplikacji do rozpoznawania klocków LEGOPrzydatne linki:Papers with code:https://paperswithcode.com/search?q=author%3APiotr+Rybakmodel Silver Retrieverhttps://huggingface.co/ipipan/silver-retriever-base-v1datasety Polqa i Maupqahttps://huggingface.co/datasets/ipipan/polqahttps://huggingface.co/datasets/ipipan/maupqaAplikacja do rozpoznawania klocków LEGO:https://brickognize.com/Książka "Jak zacząć podcast" - poradnik dla osób, które chcą zacząć podcastowaćNapisz do mnie:Michal Dulemba | LinkedInSubskrybuj podcast:Apple PodcastsSpotifyGoogle PodcastsPodcast AddictRSSKorzystam z: Buzzsprout (hosting odcinków):https://www.buzzsprout.com/?referrer_id=1783532Riverside (aplikacja do zdalnego nagrywania):https://www.riverside.fm/?via=dulemba
Podstawowe informacje o goście i tematyce rozmowy.
Rozmowa o systemach odpowiedzi na pytania w języku polskim, ich rozwój i znaczenie.
Opis projektów i inicjatyw, które mają na celu rozwój narzędzi NLP dla języka polskiego.
Rozmowa o zastosowaniach i technikach w Question Answering, w tym na przykładzie chatbotów.
Refleksje na temat świadomości i filozofii w modelach sztucznej inteligencji.
Opis projektów i datasetów QA, w tym POLKA, Małpka i Silver Retriever, oraz techniki ich tworzenia.
Rozmowa o technikach treningu modeli sztucznej inteligencji, w tym na przykładzie retrievera.
Porównanie modeli sztucznej inteligencji, w tym E5, oraz techniki zastosowania ich w praktyce.
Piotr Rybak omawia techniki filtracji i augmentacji danych, które znacząco poprawiają jakość modeli. Rzadkość i złożoność danych jest omówiona jako kluczowe wyzwania.
Rozdziały i streszczenia generowane automatycznie. Pełna transkrypcja nie jest publikowana — wyszukaj frazę, aby zobaczyć dopasowane fragmenty.
Rozmowa z Piotrem Rybakiem - NLP researcherem w PAN w Instytucie Podstaw Informatyki
Rozmawiamy min.:
- najlepszych praktykach w budowaniu systemów typu "Retrieval"
- jak trenować modele do tworzenia embeddingów
- o budowie datasetów, tłumaczeniu angielskich i scrapowaniu
- o tym czy LLMy mogą ukrywać przed nami swoją świadomość
- czy proste rzeczy są naprawdę proste i czy są łatwe do zrozumienia
- o różnicach w wiedzy na temat polskich i angielskich QnA
- modelach Silver Retriever,
- datasetach MAUPQA i POLQA
- aplikacji do rozpoznawania klocków LEGO
Przydatne linki:
Papers with code:
https://paperswithcode.com/search?q=author%3APiotr+Rybak
model Silver Retriever
https://huggingface.co/ipipan/silver-retriever-base-v1
datasety Polqa i Maupqa
https://huggingface.co/datasets/ipipan/polqa
https://huggingface.co/datasets/ipipan/maupqa
Aplikacja do rozpoznawania klocków LEGO:
https://brickognize.com/
Książka "Jak zacząć podcast" - poradnik dla osób, które chcą zacząć podcastować
Napisz do mnie:
Michal Dulemba | LinkedIn
Subskrybuj podcast:
Apple Podcasts
Spotify
Google Podcasts
Podcast Addict
RSS
Korzystam z:
Buzzsprout (hosting odcinków):
https://www.buzzsprout.com/?referrer_id=1783532
Riverside (aplikacja do zdalnego nagrywania):
https://www.riverside.fm/?via=dulemba