Multimodalność
Dziś porozmawiamy o temacie, który związany jest ściśle ze sztuczną inteligencją i dotyczy rodzajów danych, które mogą stanowić dane wejściowe jak i wyjściowe z modelu. Jest to bardzo ważna koncepcja, która pozwala lepiej zrozumieć, jak AI wpłynie na naszą pracę i wykorzystanie w praktycznych zastosowaniach.
Cześć wszystkim, witam was w kolejnym odcinku Rozmów na Autopilocie, czyli w podcaście, w którym rozmawiamy razem z Adamem oraz z naszą społecznością. Na Ahoj rozmawiamy o nowych rzeczach, zwykle związanych z oprogramowaniem i ze sztuczną inteligencją, z tworzeniem Narzędzi lub też narzędziami, które pojawiają się na rynku i pomagają nam pracować wydajniej, zwiększać naszą produktywność, pomagają nam lepiej zrozumieć też świat, bo o tym trochę dzisiaj porozmawiamy. Dzisiejszy temat to oprzemy w zasadzie o multimodalność w AI, wytłumaczymy w ogóle czym ta multimodalność jest, a także jak przekłada się to na współczesne interfejsy, nawiązując też trochę do ostatnich wydarzeń, czyli Konferencji Google'a, konferencji OpenAI. Nawiążemy też trochę na pewno do narzędzi takich hardware'owych, z których będziemy korzystać w przyszłości.
Może zastanowimy się, jakie urządzenia czy jaki nowy rynek urządzeń otwiera się w kontekście AI. O tym już sobie też w poprzednich podcastach rozmawialiśmy, więc polecam, żebyście sprawdzili sobie Ale w zasadzie sprowadza się to do tego tematu właśnie multimodalności. Więc czym ta multimodalność w ogóle jest? Często o tym słyszymy w kontekście AI, rozmaitych urządzeń, a także rozmaitych modeli, które przetwarzają różne dane i dają nam odpowiedzi, ale te odpowiedzi bazują właśnie na pewnym inputcie, czyli na danych, które do nich wprowadzamy. No i multimodalność w zasadzie dotyczy tych wprowadzanych danych, czyli tego, w jaki sposób my przekazujemy dane do AI, do modelu, który następnie udziela nam odpowiedniej odpowiedzi.
Prosty przykład sensoru to termometr, ale może to też być żyroskop, może to też być szereg innych właśnie drobnych urządzeń, które gdzieś są zainstalowane wokół nas. No i te dane z tych wszystkich sensorów mogą być przetwarzane również przez AI. No i w końcu mamy, wydaje mi się, że stricte w kontekście multimodalności ostatni, ostatnią rzecz, którą warto wyróżnić, czyli mówiliśmy już o tym tekście, który możemy do modelu przekazać w formie mówionej, ale mamy też audio, czyli generalnie możliwość odsłuchania na przykład przez model muzyki. Albo chodzi mi tutaj też o takie dźwięki, które są dookoła nas i nas otaczają. Po pierwsze model może te dźwięki odebrać i może je przetworzyć w taki sposób, aby udzielić nam dobrej odpowiedzi w kontekście np. otoczenia, w którym się akurat znajdujemy, ale z drugiej strony model może użyć te tzw. te dźwięki otoczenia po to, żeby je zignorować, je wyciąć i np. tylko słuchać naszego głosu.
No i można powiedzieć, że to nie jest dodatek do AI, tylko że to jest coś, co jest absolutnie krytyczne i kluczowe do tego, żeby pójść dalej z AI. Czyli musimy to mieć. I tak na dobrą sprawę, jak się zastanowić nad tymi bardzo praktycznymi zastosowaniami Takie multimodalności, no to one są wszędzie. Jeśli na przykład zastanowimy się nad rozwiązywaniem takich większych problemów ludzkości, czyli potencjalnie zaprzęgnięcie jaj do tego, aby wspomagało lekarzy i służby medyczne, to tak naprawdę tutaj Połączenie tych wszystkich inputów, nawet mówię tutaj o inputach z różnych sensorów medycznych, bo przecież jeśli ktoś jest po operacji podłączony do jakiegoś oprogramowania, które sczytuje jego funkcje życiowe, to naturalnie model powinien rozumieć ten interfejs i powinien się z nim móc połączyć.
Wydaje mi się, że to na pewno będzie bardzo powszechne zastosowanie AI, które będzie analizowało takie dane. Już wczoraj o tym czytałem, Nie wiem, czy to jest idealnie dobra statystyka, bo mówił mi o tym znajomy, więc nie chcę powtarzać, ale rozmawialiśmy o tym właśnie wczoraj, że w Stanach jest codziennie 12 przypadków, gdzie ktoś przynosi broń do szkoły. I teraz w szkołach w ogóle są takie skanery, przez które trzeba przejść bramki. No i oczywiście trudno jest, żeby ktoś, np. tysiące osób, które tam się przewijają na uczelni czy w szkole, analizował wszystkie te osoby, które przez bramki przechodzą. Raczej jest to niemożliwe we wszystkich szkołach.
Natomiast robi to AI. I świetnie wykrywa z bardzo dużą skutecznością niebezpieczne przedmioty, które są wnoszone do takich miejsc. W ogóle też, jak sobie myślę o tym bardziej w takim biznesowym zastosowaniu, to cały biznes marketingowo-retailowy, gdzie na przykład ludzie przechodzą sobie do galerii i wybierają jakieś ciuchy czy tam jakieś różne rzeczy, To jest ogromna przestrzeń do tego, aby po prostu AI analizowało takie nagrania, czy zachowania, czy reakcje ludzi po prostu, którzy na przykład są na zakupach po to, żeby rekomendować positioning produktów i wszystkie inne rzeczy.
To jest AI, które również działa właśnie end-to-end, czyli do tej pory Autopilot Tesli był programowany, czyli był to po prostu kod pisany przez programistów, który dążył do tego, żeby opisać możliwie jak najlepsze... Milion ifów. I w drzewo, i w krzak, i w człowiek. No i teraz mamy wersję 12.3.6. To w momencie mówienia tekstów jest wersja najnowsza. Ona szybko się literuje, bo dopiero był jakiś tam 12.2.1 i tak dalej, i tak dalej. No i ją charakteryzuje fakt, że tak jak wcześniej były dane z czujników i one trafiały do kodu, a następnie przekładały się na akcje, które podejmował samochód, tak w tym momencie dane z czujników, na przykład z kamer,
Lecą bezpośrednio do AI, a jego wynikiem, tak jakby wygenerowaną odpowiedzią ChartGPT jest właśnie zestaw akcji, które ma podjąć samochód do tego, żeby dalej jechać. No i okazuje się, że pomiędzy tam wersją 11, czy tam którąś tego autopilota, czyli tą, która działała na kodzie, a tą, którą działa na AI, jest ogromny przeskok jakości, szczególnie pod kątem właśnie umiejętności Poruszania się w sytuacjach, które ciężko przewidzieć, w sytuacjach takich awaryjnych i tak dalej, czy w ogóle sytuacjach, nie wiem, mamy remont na drodze i trzeba jakoś inaczej przejechać, to do tej pory samochód nie był w stanie albo źle podejmował takie decyzje.
W tym momencie działa to znacznie, znacznie lepiej i oczywiście zdarzają się jeszcze sytuacje, że na przykład skręci nie tak jak trzeba albo że będzie próbował wjechać na przeciwległy pas albo cokolwiek. Więc to nadal mówimy tutaj o wersji beta i takiej, która musi być nadzorowana przez człowieka, ale jednocześnie ten progres jest ogromny. I ja myślę, że to jest najlepszy znany mi przykład tego, żeby można było zobaczyć, z czym się wiąże właśnie rozwój AI. I teraz jesteśmy na poziomie powiedzmy człowieka, a zaraz będziemy na poziomie nadczłowieka, ze względu na to, że samochód będzie miał, czy tam ma, nie wiem, 12, czy 14, czy 16 kamer, ma jakieś tam mnóstwo,
Pokazano wszystkie 9 dopasowań. Transkrypcja generowana automatycznie i niesprawdzana ręcznie — może zawierać błędy.
Wprowadzenie do tematu multimodalności w AI, omówienie różnych form wprowadzania danych do modeli, takich jak tekst, głos, wideo i sensorów.
Rozważania nad multimodalnością w modelach AI, omówienie różnicy między unimodalnym a pełnowymiarowym modeliem, w tym wpływ na szybkość odpowiedzi i rozumienie emocji.
Omówienie praktycznych zastosowań multimodalności, takich jak leczenie medyczne, bezpieczeństwo domowe, marketing i transport, z podkreśleniem roli emocji w interakcjach z modelami AI.
Rozmowa o przyszłości AI, specjalnie w kontekście multimodalności, i jej potencjalnych zastosowań, takich jak transport, marketing i bezpieczeństwo.
Analiza strategii OpenAI i wpływ jej decyzji na rynek AI, w tym odejście kluczowych specjalistów i ich wpływ na konkurencję.
Ważność specjalistów w branży AI i ich wpływ na rozwój technologii, w tym odchód Ilii Suskewera z OpenAI.
Wątpliwości wobec etycznych aspektów rozwoju AI, szczególnie w kontekście OpenAI i rynek modeli AI.
Rozdziały i streszczenia generowane automatycznie. Pełna transkrypcja nie jest publikowana — wyszukaj frazę, aby zobaczyć dopasowane fragmenty.
Kliknij, aby znaleźć fragmenty, w których pada.