Mentionsy Mentionsy
KajoData - Analiza danych dla każdego
KajoData - Analiza danych dla każdego

Data Engineer vs AI | Big Data - granice bezpieczeństwa, prywatności i kontroli | Marek Czuma

19.10.2025 ·58 min 54 s

KajoData:🟨 Społeczność analityków KajoDataSpace🟦 Kursy - Excel, Power Query, SQL, PowerBI, Python, TableauMarek Czuma🟩 Akademia Big Data🟫 Big Data Po PolskuW tym odcinku spotkałem się z Markiem Czumą – inżynierem danych, twórcą Akademii Big Data i podcastu „Big Data po polsku”. To rozmowa o świecie ogromnych zbiorów danych, technologii rozproszonych i granicach tego, co możemy dziś przetworzyć. Zaczynamy od pytania, czy danych nie jest po prostu za dużo – i czy w tej „danej ropie XXI wieku” nie zaczynamy się powoli topić. Marek tłumaczy, jak naprawdę wygląda branża Big Data, na czym polega przetwarzanie rozproszone i dlaczego dodanie „kolejnych serwerów” nie zawsze rozwiązuje problem.Rozmawiamy też o różnicach między analitykiem danych a inżynierem danych – gdzie kończy się Excel, a zaczyna Apache Spark. Marek pokazuje, że Big Data to nie tylko programowanie, ale sposób myślenia – inżynierski, systemowy, zrozumiały dopiero wtedy, gdy wiesz, co dzieje się „pod spodem”. Zastanawiamy się też, jak wygląda ścieżka rozwoju od analityka do inżyniera danych i które umiejętności są tu naprawdę kluczowe.W drugiej części schodzimy na meta-poziom – rozmawiamy o przyszłości zawodów IT w erze sztucznej inteligencji, o tym, co AI może zmienić (a czego raczej nie ruszy), i które systemy robią na Marku największe wrażenie – od Google Maps po infrastrukturę NSA. To szczera, inspirująca rozmowa o tym, jak wygląda świat danych od środka – technicznie, organizacyjnie i... filozoficznie.

podejściu rozproszonym. W angielsku distributed. Storage, computing, processing. Mamy podejście rozproszone, to znaczy, że my możemy pracować na wielu maszynach tak, jakbyśmy pracowali na jednej. Przykładem czegoś takiego jest Apache Spark. To jest technologia, która pozwala przetwarzać dane. Czyli my mamy, bierzemy jakiegoś Excela, załóżmy jakąś CSVkę, tylko że jest ich na przykład miliard, na każdej mamy powiedzmy 10 tysięcy wierszy. I my to sobie wciągamy, tych miliard Excel i CSVek jest rozłożonych na wielu maszynach i my dzięki Sparkowi Możemy napisać program tu, na laptopie, logicznie, zajmując się tylko logiką, czyli tylko tym właśnie, jak wyciągnąć kolumny odpowiednie, jak przetworzyć te kolumny, jak przefiltrować te wiersze między sobą, porównać i tak dalej.

Czyli znajomość podstaw, później znajomość bardziej optymalizacji tego wszystkiego. Banały, ale nie zapominajmy o tym, że to jest konieczne. Druga rzecz, myślenie bardziej abstrakcją w ramach tych technologii. Czyli mamy już wspomnianego Sparka, który przetwarza dane, no to nie uczmy się tylko Sparka, uczmy się... Frameworku do przetwarzania danych. Uczmy się, co to jest distributed processing, przetwarzanie rozproszone. Patrzmy na architekturę, jak Spark to zrobił. Nie funkcja, jaką ja muszę wykonać, wywołać, żeby połączyć dwa zbiory, tylko jak on pod spodem to robi, gdzie on przesyła te dane, w jaki sposób on myśli, że te dane są pociągane.

Jeżeli ja umiem tak myśleć, no to wywołanie tych funkcji staje się dużo bardziej dojrzałe, bo ja wiem, co się dzieje pod spodem, ja wiem, czym się drobne smaczki różnią, a co więcej, jak ja potem przysiądę się na inny framework, bo zaraz wejdzie zupełnie nowa alternatywa do przetwarzania danych dla na przykład Sparka, To ja już będę automatycznie, nawet mimowolnie porównywał te dwie rzeczy, więc będę na wyższym poziomie rozumienia. Będę czytał dokumentację i będę myślał, aha, a w Sparku to jest zrobione inaczej, a tutaj jak to jest zrobione w taki sposób, to to się świetnie zgrywa, bo to zapełnia jakieś tam problemy, które Spark miał na przykład. Ale to jest możliwe tylko jeśli ja myślę trochę bardziej abstrakcyjnie, czyli nie tylko funkcja, wywołanie funkcji, Tylko to jest mój zarzut zresztą największy do wielu kursów, które widzę online, które mają cię nauczyć właśnie tego przysłowiowego sparka, że tam wchodzisz i masz po prostu zestaw funkcji, które masz wywołać i uczysz się co to jest.

No to sorry, no to ja mogę sobie dokumentację przeczytać. Ja bym chciał, żeby ktoś mnie nauczył jak to działa pod spodem i na tej bazie jak te funkcje działają. Więc jeżeli ja chcę się uczyć, To ja najpierw, to ja na tych technologiach chcę się uczyć również abstrakcji, a nie technicznego tylko wykonania. Tym bardziej, że wiesz, ja teraz mogę być ekspertem od właśnie Sparka czy czegoś, a pójdę do drugiej firmy, a tam tego nie wykorzystują. I co ja teraz powiem? A, to ja potrzebuję dwóch lat, żeby się tego nauczyć? No nie, ja muszę się dużo szybciej przestawić. Więc takie myślenie abstrakcją, to jest na pewno to, co jest u super eksperta konieczne. Następna rzecz w ramach Super Eksperta to umiejętność optymalizacji, czyli zajrzenia pod spód, nie tylko wiem właśnie już tak ogólnie, umiem zbudować pipeline, no ale dobra, jak to pod spodem działa?

Bo często są różne konfiguracyjne, takie delikatne smaczki, które jak tu ustawisz, to mają ogromne przełożenie. I ja muszę wiedzieć, jak to działa pod spodem. Dam przykład, żeby to nie było gołosłowne. Jest takie wielkie jako system Databricks. I to jest ekosystem chmurowy, gdzie tam można cały system bazujący na danych zrobić. W jego sercu leży właśnie wspomniany przeze mnie Spark. Wybaczcie nasi słuchacze, ja po prostu lubię tę technologię. Ja się jej nauczyłem, więc o niej mówię. I teraz tak. To jest system, który bazuje na chmurze i on podpina się do różnych dostawców chmurowych takich jak np.

No bo logicznie to jest tak. Odpalam Sparka. Spark zaciąga dane, przetwarza, wrzuca do tabelki. Zaciąga, przetwarza, wrzuca do tabelki. Gdzie tam może być problem? Problem jest taki, się okazuje, że jeżeli ja cały czas nasłuchuję... To znaczy, że ja odpytuję serwis, który przechowuje dane. Jeżeli ja odpytuję, to musimy poznać cennik tego serwisu i się okazuje, że to, że przechowujemy dużo danych, to pobiera pieniądze, ale on jeszcze więcej pobiera pieniędzy za to, że my odpytujemy. Czyli, że na przykład wylistujesz pliki, że pobierzesz, że wrócisz plik. Za każdą z takich zapytań masz dodatkowe dolary płacisz, a właściwie centy, to są tam w ogóle dziesiąte, wiesz, trzy miejsca po przecinku albo dwa dolara, albo centa nawet, już nie pamiętam.

Pokazano wszystkie 6 dopasowań. Transkrypcja generowana automatycznie i niesprawdzana ręcznie — może zawierać błędy.