Ten z urodzinami Microsoftu i zasobożernym AI
W piątym odcinku Podcastu Technologicznego:- krytyczna podatność w Erlang/OTP- 50 lat Microsoftu- dlaczego boty AI crawlując internet szkodzą- jak przestępcy podszywają się pod firmy
Znaczy mi się kojarzy parę rzeczy, ale nie będę o tym mówił. Natomiast poważnie, to jest z mojej perspektywy tak, że rozwój technologiczny pozwala po raz kolejny robić te same sztuczki, tylko łatwiej, bardziej skutecznie albo w taki sposób, w jaki jeszcze nikt tego nie robił. Bo to, o czym chcemy rozmawiać, czyli organizacje, które się Nadziewają na ataki, bo ktoś się pod nich podszył. To nie jest nic nowego. To się zdarza od lat. Natomiast w tym momencie rzeczywiście możliwość duplikowania właściwie całego wizerunku organizacji, całego funkcjonowania organizacji też z użyciem AI. Jest na tyle łatwa, na tyle dostępna, że masowość tego moim zdaniem będzie narastać i coraz trudniej też będzie to wykrywać, bo się przyzwyczajamy, że jednak wierzymy w to, co widzimy.
I teraz z tej perspektywy, jednym z podstawowych mechanizmów, co jest bardzo przerażające z mojej perspektywy, jest to, że po prostu wykorzystując algorytmy AI i temu podobne, można stworzyć za pomocą takich sygnałów czy danych, które Bardzo często każdy z nas w mniejszym lub większym stopniu zostawia w internecie. Można odtworzyć czy budować naszego brata bliźniaka do tego, żeby właśnie dokonać jakiejś decyzji płatniczej albo podobnych rzeczy w firmach, w których pracujemy, albo wręcz na takim styku my kontra nasi kontrahenci.
Bo tak jak kiedyś można było zadzwonić do firmy i udając prezesa powiedzieć, panie Zbyszku czy pani Jadziu, proszę teraz przelać milion złotych na taką Tytułem takiej faktury tu podaję przez telefon danej. Organizacja, która była dobrze ustawiona, nie obsługiwała takiego przypadku. To znaczy prezes, nie prezes, należy wysłać maila, jest jakiś kontroling, to przechodzi przez jakiś mechanizm weryfikacji. Ktoś ten przelew wprowadza, ktoś potem go zatwierdza i przelewa te pieniądze i tak dalej. To, że teraz można taką osobę skopiować AI-em, wiadomo, podnosi wiarygodność tego, ale nadal, jeżeli mamy procedury w organizacji wprowadzone tak samo, to to po prostu nie zadziała. No i właśnie o to pytam. Jakie mogą być procedury, które się obronią tego typu atakom?
Ale to w ogóle moje też pierwsze zderzenie w cudzysłowie ze stałym łączem, bo oni byli non stop podłączeni do tego ISDN-u. I to działało całą dobę, bo też musieli mieć z niemiecką centralą połączenie, więc tam nie było możliwości, żeby to wyłączać, więc nie chcę wiedzieć, ile oni wtedy płacili pieniędzy za to łącze. To były jakieś kosmiczne ceny, więc to, że ja siedziałem tam wiele godzin, bo się uczyłem tych systemów, to było chyba dla nich najmniejszym kosztem z tego wszystkiego. Ale wracając do samego Microsoftu. Przez ostatnie lata Microsoft generalnie bardzo dużo zmieniał. Ma bardzo dużą taką tendencję do tego, żeby olbrzymią ilość informacji o aktywności użytkowników przenosić do chmury. W chwili obecnej Microsoft już ma istotną część przychodów czy zysków z obszaru AI i wszelkiego rodzaju rozwiązań w tym obszarze, co wbrew pozorom nie jest takie oczywiste,
Okazało się, że po prostu skończyło się miejsce na serwerze, bo się zapchały logi. Zapchało się ich na tyle dużo, że jakby Log Rotate nie zadziałał raz na dobę i tych logów sobie tam nie posprzątał. Znaczy w sensie, że tak dużo zostało wygenerowanych przez dobę, że już system nie zdążył zadziałać i się wyczyścił. Tak, dokładnie tak. I okazało się, że po prostu jeden z operatorów właśnie AI-owych crawlował w kółko bez przerwy treści, które były hostowane w tym serwisie. Bez jakiejkolwiek logiki, bo to był serwis, który hostował rzeczywiście dużo, bo tam generalnie pewnie kilkadziesiąt gigabajtów kontentu tekstowego, ale to były treści, które się nigdy nie zmieniały. W momencie publikacji one już zawsze zostawały takie same i często wisiały tam od końca lat 90.
Teraz jako święta czytałem kogoś na Twitterze, kto się żalił, że dobił do sufitu swojej subskrypcji transferu w jakiejś hostingowni. To mu się nigdy wcześniej przez lata nie zdarzyło właśnie dlatego, że modele potrzebujące danych do trenowania harwestowały w kółko jego serwis i nie da się tego prosto zablokować. Są rozwiązania, które wchodzą na rynek, które właśnie sobie z tym radzą. Chociażby jest coś takiego, co Cloudflare zbudował, co się nazywa Labyrinth. Co po prostu ma utrudnić takie kreulowanie, żeby ono nie paraliżowało naszej infrastruktury, żeby też ten ruch nie przychodził do nas, nie zjadał naszego łącza itd. No ale to jakby problem jest gdzie indziej, bo funkcjonujemy w internecie, gdzie jednak mamy pewne zasady, gdzie uczymy się i utrzymujemy pewne standardy i potem przychodzą firmy od AI i mówią nie respektujemy tego.
Tak, to jest bardzo ciekawe z racji tego, że jak przeczytałem gdzieś, że obecnie crawlery firm AI odpowiadają za 1% zapytań, ale dochodzą nawet do 40-50% ruchu. Więc to zaczyna rzeczywiście być olbrzymi problem, no bo też Google jak rzeczywiście ma te narzędzia do crawlowania, no to one już są na tyle sprytne, że weryfikują tą częstotliwość sprawdzania. Zresztą każdy system wordpressowy czy tam podobne rzeczy Pozwalają nawet wskazywać tym crawlerom, jak często mogą, czy chcą, czy powinny crawlować te treści, bo jak one się nie zmieniają, to bez sensu je non stop mielić w kółko.
Z drugiej, jeśli nawet wdrożymy tego typu rozwiązania, bo to nie jest tylko AI Labyrinth od Cloudflare'a, ale to są różnego rodzaju inne systemy typu chyba Anubis, to się nazywa, albo Nepenthes, nie umiem tego przeczytać, które pozwalają w jakiś sposób albo np. zamknąć w pętli te crawlery AI'owe albo te podobne rzeczy. Ale to nie w tym rzecz. To nie jest case, w którym każda firma, każda organizacja pozwala sobie na to, żeby poświęcać swoje zasoby na bronienie się przed, jakby nie patrzeć, trochę cyberatakami. Bo to jeśli jakaś infrastruktura producenta AI-owego doprowadza do takiego lokalnego DDoS-a, bo tak ostro jedzie z tymi crawlerami,
Wcale to jakby rodzi dużo pytań, bo po pierwsze rozumiem, że najbardziej atrakcyjne dla tych modeli są dane, które na pewno zostały wytworzone nazwijmy to analogowo, w sensie bez użycia LLM-ów. To też jest dyskusja a propos mety, która zdaje się, OpenAI chyba też, masowo crawlowała np. bazy danych z publikacjami, no bo wiedzieli, że to są książki, które nie zostały napisane AI-em, więc jakby ich wartość dla modelu jest dużo większa. Generalnie wartość książek jest w ogóle duża, czy to publikacji naukowych, czy jakichś innych. Jeżeli chodzi o potem jakość informacji, którą dostajesz z tych modeli. Ale to jest trochę tak, że jak ja sobie, nie wiem, napiszę na blogu artykuł i ty chcesz coś z tym artykułem zrobić, to jednak musisz się do mnie odezwać.
Myślę, że będziemy go obserwować. Tutaj też można będzie w dowolną stronę odpływać, bo to jest kwestia własności intelektualnej i kwestia zasobów. A znowu na samym końcu wbrew pozorom te treści, które tego typu systemy generują. Ja już zaczynam powoli odczuwać, że nie to, że doszły do sufitu, ale Do pewnego poziomu da się z tego korzystać, w pewnym poziomie AI nie jest w stanie wielu rzeczy zrobić. Na poziomie analitycznym pomaga, ale na poziomie kreatywnym to tylko przeszkadza. Boję się jednej rzeczy. Ostatnio rozmawiałem właśnie z kimś a propos tego jak sobie radzić z takim przypadkiem.
Pokazano wszystkie 10 dopasowań. Transkrypcja generowana automatycznie i niesprawdzana ręcznie — może zawierać błędy.
Kliknij, aby znaleźć fragmenty, w których pada.
W piątym odcinku Podcastu Technologicznego:
- krytyczna podatność w Erlang/OTP
- 50 lat Microsoftu
- dlaczego boty AI crawlując internet szkodzą
- jak przestępcy podszywają się pod firmy