Multimodalność
Dziś porozmawiamy o temacie, który związany jest ściśle ze sztuczną inteligencją i dotyczy rodzajów danych, które mogą stanowić dane wejściowe jak i wyjściowe z modelu. Jest to bardzo ważna koncepcja, która pozwala lepiej zrozumieć, jak AI wpłynie na naszą pracę i wykorzystanie w praktycznych zastosowaniach.
Czyli mamy wideo, mamy obrazy, mamy coś, o czym się nie mówi jeszcze, a będzie się mówić zaraz bardzo dużo, czyli dane z rozmaitych czujników, sensorów, z rozmaitych rzeczy, które na przykład mamy wbudowane już w nasze urządzenia, z których korzystamy. Przykładowo tutaj to, gdzie już to działa i to naprawdę dobrze, to samochody, czyli w takiej Tesli czy w innych nowoczesnych samochodach jest masa czujników, masa sensorów, które nie tylko obserwują otoczenie, na przykład z kamer, ale też są to sensory, które przykładowo coś mierzą. Mierzą jakieś poziomy, mierzą na przykład odległości, I tych sensorów jest naprawdę masa, które mogą podawać nam czy skupiać się na jakiejś konkretnej danej.
Działa tak, że do tej pory nie byliśmy w stanie tego robić, czyli na przykład porównanie ze sobą ogromnych zestawów danych. W celu zauważenia jakichś rzeczy, które do tej pory były niezauważalne. No i więc trudno mi to tak jakby o tym w tym momencie mówić, po prostu muszę tego doświadczyć. Wydaje mi się, że jak OpenAI udostępni nam możliwość właśnie przesyłania, no właśnie tej pełnej multimodalności, To będę w stanie na ten temat więcej powiedzieć. Więcej ja polecam, chyba o tym wspominałem w jednym z ostatnich odcinków, polecam wpisać sobie na YouTubie Tesla FSD, czyli Full Self Drive V12, a najlepiej jakiś najnowszy film.
To jest AI, które również działa właśnie end-to-end, czyli do tej pory Autopilot Tesli był programowany, czyli był to po prostu kod pisany przez programistów, który dążył do tego, żeby opisać możliwie jak najlepsze... Milion ifów. I w drzewo, i w krzak, i w człowiek. No i teraz mamy wersję 12.3.6. To w momencie mówienia tekstów jest wersja najnowsza. Ona szybko się literuje, bo dopiero był jakiś tam 12.2.1 i tak dalej, i tak dalej. No i ją charakteryzuje fakt, że tak jak wcześniej były dane z czujników i one trafiały do kodu, a następnie przekładały się na akcje, które podejmował samochód, tak w tym momencie dane z czujników, na przykład z kamer,
...innych czujników, które wykrywają różne rzeczy na drodze, jest w stanie to zestawić. Można też sobie właśnie zobaczyć, zerknąć nawet na wizualizację, którą tworzy Tesla, czyli jak widzi świat Autopilot Tesli i zobaczyć, że na przykład jest w stanie tak jakby oglądać pięć pasów po prostu w bok, czy widzieć to, co się dzieje na skrzyżowaniu Tego, co nierzadko nawet nie widzi człowiek, to wynika z ograniczonego pola widoczności, a ten obraz pochodzący z wielu kamer jest w stanie być połączony ze sobą w taki sposób, aby uchwycić znacznie więcej niż mogłoby się wydawać możliwe.
Pokazano wszystkie 4 dopasowania. Transkrypcja generowana automatycznie i niesprawdzana ręcznie — może zawierać błędy.
Wprowadzenie do tematu multimodalności w AI, omówienie różnych form wprowadzania danych do modeli, takich jak tekst, głos, wideo i sensorów.
Rozważania nad multimodalnością w modelach AI, omówienie różnicy między unimodalnym a pełnowymiarowym modeliem, w tym wpływ na szybkość odpowiedzi i rozumienie emocji.
Omówienie praktycznych zastosowań multimodalności, takich jak leczenie medyczne, bezpieczeństwo domowe, marketing i transport, z podkreśleniem roli emocji w interakcjach z modelami AI.
Rozmowa o przyszłości AI, specjalnie w kontekście multimodalności, i jej potencjalnych zastosowań, takich jak transport, marketing i bezpieczeństwo.
Analiza strategii OpenAI i wpływ jej decyzji na rynek AI, w tym odejście kluczowych specjalistów i ich wpływ na konkurencję.
Ważność specjalistów w branży AI i ich wpływ na rozwój technologii, w tym odchód Ilii Suskewera z OpenAI.
Wątpliwości wobec etycznych aspektów rozwoju AI, szczególnie w kontekście OpenAI i rynek modeli AI.
Rozdziały i streszczenia generowane automatycznie. Pełna transkrypcja nie jest publikowana — wyszukaj frazę, aby zobaczyć dopasowane fragmenty.
Kliknij, aby znaleźć fragmenty, w których pada.