Mentionsy Mentionsy
Rozmowy na Autopilocie
Rozmowy na Autopilocie

Multimodalność

31.05.2024 ·38 min 20 s · 7 rozdziałów

Dziś porozmawiamy o temacie, który związany jest ściśle ze sztuczną inteligencją i dotyczy rodzajów danych, które mogą stanowić dane wejściowe jak i wyjściowe z modelu. Jest to bardzo ważna koncepcja, która pozwala lepiej zrozumieć, jak AI wpłynie na naszą pracę i wykorzystanie w praktycznych zastosowaniach.

0:00 · Wprowadzenie do tematu multimodalności 1

Na przykład mówiłem o Ray-Banach, które dostały ostatnio update taki, że widzą świat i potrafią to, co zobaczą, po prostu dla nas o tym opowiedzieć. Więc ta multimodalność polega na tym, że możemy albo przekazać wideo w formie już nagranej, albo w czasie rzeczywistym wręcz dane urządzenie może widzieć świat i przetwarzać ten świat, co też ostatnio na konferencji pokazało OpenAI, że faktycznie tam był taki bardzo prosty przykład z patrzeniem na kartkę, gdzie chłop po prostu pisał jakieś różne równania matematyczne i próbował mu model pomóc je rozwiązywać. No ale też tutaj wideo jest kolejnym tym elementem multimodalności, o którym możemy mówić.

5:28 · Multimodalność w modelach AI 4

Następnie ten tekst trafia do modelu. On udziela odpowiedzi również w formie tekstowej, no i odpowiedź tekstowa jest ewentualnie kolejnym modelem zamieniana na głos. W sytuacji, gdy mamy do czynienia z modelem w pełni multimodalnym, z udostępnionymi oczywiście funkcjami przesyłania różnych formatów danych, możemy przesłać po prostu ten plik audio i uzyskać plik audio jako autopowiedź. I różnica Jest nie tylko techniczna, a wiążąca się na przykład z szybkością odpowiedzi, no bo nie musimy dokonywać tego dodatkowego przetwarzania, ale także w rozumieniu różnego rodzaju aspektów tej wypowiedzi, chociażby rozpoznawanie emocji, którą widzieliśmy na OpenAI, tej prezentacji, która była w tym tygodniu, gdzie widzieliśmy, że model był w stanie właśnie

Trudno powiedzieć, na jakim poziomie teraz to się dzieje. Już widzieliśmy na OpenAI, że robi to wrażenie, ale nie mamy jeszcze dostępu do API właśnie tego umożliwiającego przesyłania różnego rodzaju plików, więc będziemy musieli to zobaczyć w praktyce, jak to działa. Natomiast tutaj należy pamiętać jeszcze o jednej rzeczy, czyli nadal jeżeli mamy model multimodalny, to on działa w tak zwanym trybie end-to-end, czyli przesyłamy na przykład plik audio i otrzymujemy plik audio, czyli od początku do końca jest tutaj przetwarzany ten jeden format. Natomiast trzeba pamiętać, że sam model w środku posiada tylko tą swoją główną bazową wiedzę, która jak wiemy powszechnie jest na swój sposób

To jest takie, jak teraz się mówi o natychmiastowej reakcji, to taka natychmiastowa reakcja będzie miała miejsce w sytuacji, gdy będziemy się opierać wyłącznie o bazową wiedzę modelu. Czyli coś mu pokażemy i powiemy, powiedz jaki to kwiatek na przykład. Ale w momencie, gdy będziemy chcieli powiedzieć, zobacz na to zdjęcie albo na jakiś tam dokument i porównać z moimi projektami, to będziemy musieli w jakiś sposób zaprojektować ten system, żeby był w stanie zestawiać sobie albo na przykład rozpoznawać osoby z naszej rodziny, okolicy albo czegokolwiek. Więc będziemy musieli posiadać system, który będzie w stanie coś takiego modelowi dostarczyć, wytłumaczyć, odpowiednio podać i odpowiednio przetworzyć.

Ja nie mam co do tego wątpliwości i mam akurat to szczęście, że moja wiedza technologiczna pozwala mi tego doświadczać już dziś. Ok, to zaraz Cię zapytam, jak dokładnie. Właśnie wydaje mi się, że warto by było przejść do omówienia tych bardziej praktycznych zastosowań multimodalności i tego, czego możemy się spodziewać. No bo faktycznie teoria jest taka, jak powiedzieliśmy, tak jak słusznie wspomniałeś, ja tutaj podkreśliłem rolę tego inputu, że ten input może być multimodalny. Ty wspomniałeś też o outputcie i oczywiście tak jest, że model będzie mógł, czy może już teraz, teraz są różne modele, które się w tym specjalizują, Dają nam na przykład obrazy albo dają nam tekst, ale zaraz będą nam dawać i tekst i obrazy, zaraz będą nam też dawać wideo i wszystkie inne rzeczy, które prawdopodobnie zostaną połączone w jednym miejscu.

12:50 · Praktyczne zastosowania multimodalności 4

Ciekawe jest też to, że dodałeś do mojej listy rzeczy, która może być inputem dla modelu, coś o czym, co pominąłem, a co jest równie istotne. Wspomniałeś tutaj o pewnych emocjach i to faktycznie jest, może to płynie jakoś na przykład i z obrazu i z dźwięku, że na przykład model jest w stanie rozpoznać emocje lub też mimikę albo gesty. Jak my się zastanowimy nad tym, jak my funkcjonujemy w otoczeniu Jak to zrobić, żeby faktycznie takie jaj w ogóle mogło zacząć doświadczać tego, co my? No bo oczywistym jest, że jeśli tylko przekazujemy tekst, to ten tekst jest wyprany z tych emocji, jest wyprany z naszej mimiki, jest wyprany z naszej reakcji i zawiera tylko bardzo suchy przekaz, na podstawie którego trudno jest wyczytać tak naprawdę prawdziwą intencję.

No i można powiedzieć, że to nie jest dodatek do AI, tylko że to jest coś, co jest absolutnie krytyczne i kluczowe do tego, żeby pójść dalej z AI. Czyli musimy to mieć. I tak na dobrą sprawę, jak się zastanowić nad tymi bardzo praktycznymi zastosowaniami Takie multimodalności, no to one są wszędzie. Jeśli na przykład zastanowimy się nad rozwiązywaniem takich większych problemów ludzkości, czyli potencjalnie zaprzęgnięcie jaj do tego, aby wspomagało lekarzy i służby medyczne, to tak naprawdę tutaj Połączenie tych wszystkich inputów, nawet mówię tutaj o inputach z różnych sensorów medycznych, bo przecież jeśli ktoś jest po operacji podłączony do jakiegoś oprogramowania, które sczytuje jego funkcje życiowe, to naturalnie model powinien rozumieć ten interfejs i powinien się z nim móc połączyć.

Ale chodziło o to, że zdecydowanie większa szansa jest na poprawną diagnozę w momencie, kiedy lekarz pracuje razem z modelem, niż gdy model pracuje sam albo lekarz pracuje sam. I ten wzrost był ogromny. To, co jeszcze widzę, to na pewno wspomniałeś właśnie też o tym rozpoznawaniu postaci na przykład. No na pewno, jeśli chodzi o różne autonomiczne czy pojazdy, czy roboty, które teraz będą wchodzić na rynek, A nawet takie systemy bezpieczeństwa po prostu, takie jak system bezpieczeństwa oparty o kamery i możliwość na przykład rozpoznawania, kto przychodzi do naszego domu, czy to jesteśmy my, czy nie, w zależności od tego uruchamiania alarmu, czy jakichś tam rzeczy i też w oparciu o różne inne czujniki.

Jakby zaufać komputerom. Może człowiek będzie przydatny tylko w jakiś tam szczątkowych operacjach do wykonania. Więc wydaje mi się, że to też będzie ogromny przełom. Nie wiem jak Adam, co ty myślisz o tym? Masz jakieś pomysły? Wydaje mi się, że trudno przewidzieć i naprawdę trudno przewidzieć, w jakim kierunku to się rozwinie i jakie będą zastosowania i jakbym miał coś obstawiać, to wydarzy się coś, czego nie jesteśmy w stanie teraz zauważyć, ze względu na to, że mówimy o narzędziu, które jest zdolne do robienia rzeczy, które do tej pory nie były możliwe. Czyli szczególnie w połączeniu, bo to nie chodzi o to, że nagle jest nowe prawo fizyki wynalezione, tylko po prostu sposób połączenia tego już znamy.

21:32 · Przyszłość AI i multimodalności 8

Działa tak, że do tej pory nie byliśmy w stanie tego robić, czyli na przykład porównanie ze sobą ogromnych zestawów danych. W celu zauważenia jakichś rzeczy, które do tej pory były niezauważalne. No i więc trudno mi to tak jakby o tym w tym momencie mówić, po prostu muszę tego doświadczyć. Wydaje mi się, że jak OpenAI udostępni nam możliwość właśnie przesyłania, no właśnie tej pełnej multimodalności, To będę w stanie na ten temat więcej powiedzieć. Więcej ja polecam, chyba o tym wspominałem w jednym z ostatnich odcinków, polecam wpisać sobie na YouTubie Tesla FSD, czyli Full Self Drive V12, a najlepiej jakiś najnowszy film.

To jest AI, które również działa właśnie end-to-end, czyli do tej pory Autopilot Tesli był programowany, czyli był to po prostu kod pisany przez programistów, który dążył do tego, żeby opisać możliwie jak najlepsze... Milion ifów. I w drzewo, i w krzak, i w człowiek. No i teraz mamy wersję 12.3.6. To w momencie mówienia tekstów jest wersja najnowsza. Ona szybko się literuje, bo dopiero był jakiś tam 12.2.1 i tak dalej, i tak dalej. No i ją charakteryzuje fakt, że tak jak wcześniej były dane z czujników i one trafiały do kodu, a następnie przekładały się na akcje, które podejmował samochód, tak w tym momencie dane z czujników, na przykład z kamer,

Lecą bezpośrednio do AI, a jego wynikiem, tak jakby wygenerowaną odpowiedzią ChartGPT jest właśnie zestaw akcji, które ma podjąć samochód do tego, żeby dalej jechać. No i okazuje się, że pomiędzy tam wersją 11, czy tam którąś tego autopilota, czyli tą, która działała na kodzie, a tą, którą działa na AI, jest ogromny przeskok jakości, szczególnie pod kątem właśnie umiejętności Poruszania się w sytuacjach, które ciężko przewidzieć, w sytuacjach takich awaryjnych i tak dalej, czy w ogóle sytuacjach, nie wiem, mamy remont na drodze i trzeba jakoś inaczej przejechać, to do tej pory samochód nie był w stanie albo źle podejmował takie decyzje.

W tym momencie działa to znacznie, znacznie lepiej i oczywiście zdarzają się jeszcze sytuacje, że na przykład skręci nie tak jak trzeba albo że będzie próbował wjechać na przeciwległy pas albo cokolwiek. Więc to nadal mówimy tutaj o wersji beta i takiej, która musi być nadzorowana przez człowieka, ale jednocześnie ten progres jest ogromny. I ja myślę, że to jest najlepszy znany mi przykład tego, żeby można było zobaczyć, z czym się wiąże właśnie rozwój AI. I teraz jesteśmy na poziomie powiedzmy człowieka, a zaraz będziemy na poziomie nadczłowieka, ze względu na to, że samochód będzie miał, czy tam ma, nie wiem, 12, czy 14, czy 16 kamer, ma jakieś tam mnóstwo,

...innych czujników, które wykrywają różne rzeczy na drodze, jest w stanie to zestawić. Można też sobie właśnie zobaczyć, zerknąć nawet na wizualizację, którą tworzy Tesla, czyli jak widzi świat Autopilot Tesli i zobaczyć, że na przykład jest w stanie tak jakby oglądać pięć pasów po prostu w bok, czy widzieć to, co się dzieje na skrzyżowaniu Tego, co nierzadko nawet nie widzi człowiek, to wynika z ograniczonego pola widoczności, a ten obraz pochodzący z wielu kamer jest w stanie być połączony ze sobą w taki sposób, aby uchwycić znacznie więcej niż mogłoby się wydawać możliwe.

Tak że to też nie jest tak, że to, co widzimy, to już jest to, co zostało osiągnięte. A jednocześnie, żeby nie było zbyt kolorowo, pojawiają się także sygnały o tym, że OpenAI też trochę naciąga te swoje rezultaty i wyniki, szczególnie w jakichś benchmarkach, również tych prowadzonych na chatbot-arenie, gdzie to użytkownicy oceniają modele, że okazuje się, że można wytrenować, dopasować model w taki sposób, aby był możliwie tak jakby najlepiej oceniany albo najlepiej przypadał do gustu ludziom, a niekoniecznie był faktycznie skuteczny. I mówi się o tym, że osiągnęliśmy pewną barierę, bo Do tej pory w zasadzie nikt, może poza Antropik i Opus, nie przegonił GPT-4 w postępie czy w skuteczności.

Mówiliśmy tutaj o kilku punktach procentowych czy na chatbot-arenie. Natomiast faktycznego takiego przełomu nie było. Nie wiem, czy do końca się z tym zgadzam, ze względu na to, że jak patrzę blisko na tę technologię i patrzę na to, co wczoraj było możliwe, a co jest dzisiaj możliwe, to ja widzę tam progres. I nawet wrzuciłem dzisiaj taki wpis. który zacytuję, a w zasadzie zachęcę do tego, aby przejść sobie do narzędzia Playground na platformie OpenAI, gdzie mamy możliwość przełączenia się w tak zwany tryb completions, a następnie wybrania modelu DaVinci 002.

Jest to model, który był udostępniony przy premierze ChatGPT 18 miesięcy temu. No i spróbujcie z nim pogadać i zobaczcie, jaka jest różnica pomiędzy tym, co mówi GPT-4 Omni, a pomiędzy tym, co mówi Tex Da Vinci 002. I tym bym zakończył, bo to pokazuje postępy, które się dzieją i których być może w tym momencie nie do końca dostrzegamy i nie jesteśmy świadomi tego, co się dzieje gdzieś tam z tyłu. Tak, ja mam taką teorię niespiskową, ale wydaje mi się, że faktycznie to jest tak, że OpenAI ma ciągle taką lekką przewagę i w momencie, gdy ją tylko traci, to pokazuje coś małego, No i oczywiście wydaje mi się, że nie zboczyli z kursu mimo wszystko i dla nich jednak najważniejsze jest tworzenie AGI.

32:47 · Strategie OpenAI i rynek AI 1

A rzeczy, które pokazują po drodze, są to rzeczy takie trochę, które pomagają po prostu w tej misji, czyli pomagają w zdobyciu finansowania. Jak cały świat się hype'uje jakimś tam nowym modelem 4.0, no to oczywiście sam Altman w tym czasie idzie do inwestorów, którzy też działają pod wpływem emocji i wszyscy znajomi mówią o tym nowym modelu i tak dalej. Jest mu zdecydowanie łatwiej zabrać finansowanie na rzeczy, które tak naprawdę chcą zrobić. Jestem przekonany, że idzie tam o zdecydowanie więcej i wielu z tych rzeczy jeszcze teraz nie widzimy. Chciałbym dodać do tego jeszcze jedną, w zasadzie chyba z mojego punktu widzenia najważniejszą informację ostatnich miesięcy, czyli bardzo istotną, czyli odejście Ili Suskewera z OpenAI.

36:46 · Etyczne aspekty rozwoju AI 1

Mieć pewność, że ktoś kto to robi działa w sposób etyczny. No a tutaj tej gwarancji nie ma. Myślę, że to wszystko na dzisiaj. Bardzo wam dziękujemy za uwagę w tym odcinku i zapraszamy jak zwykle co tydzień na społeczność, gdzie jesteśmy na żywo tutaj z uczestnikami sobie jeszcze jak zwykle chwilę zostaniemy i pogadamy tak off the record. Dzięki za uwagę i do usłyszenia.

Pokazano wszystkie 19 dopasowań. Transkrypcja generowana automatycznie i niesprawdzana ręcznie — może zawierać błędy.