Data Engineer vs AI | Big Data - granice bezpieczeństwa, prywatności i kontroli | Marek Czuma
KajoData:🟨 Społeczność analityków KajoDataSpace🟦 Kursy - Excel, Power Query, SQL, PowerBI, Python, TableauMarek Czuma🟩 Akademia Big Data🟫 Big Data Po PolskuW tym odcinku spotkałem się z Markiem Czumą – inżynierem danych, twórcą Akademii Big Data i podcastu „Big Data po polsku”. To rozmowa o świecie ogromnych zbiorów danych, technologii rozproszonych i granicach tego, co możemy dziś przetworzyć. Zaczynamy od pytania, czy danych nie jest po prostu za dużo – i czy w tej „danej ropie XXI wieku” nie zaczynamy się powoli topić. Marek tłumaczy, jak naprawdę wygląda branża Big Data, na czym polega przetwarzanie rozproszone i dlaczego dodanie „kolejnych serwerów” nie zawsze rozwiązuje problem.Rozmawiamy też o różnicach między analitykiem danych a inżynierem danych – gdzie kończy się Excel, a zaczyna Apache Spark. Marek pokazuje, że Big Data to nie tylko programowanie, ale sposób myślenia – inżynierski, systemowy, zrozumiały dopiero wtedy, gdy wiesz, co dzieje się „pod spodem”. Zastanawiamy się też, jak wygląda ścieżka rozwoju od analityka do inżyniera danych i które umiejętności są tu naprawdę kluczowe.W drugiej części schodzimy na meta-poziom – rozmawiamy o przyszłości zawodów IT w erze sztucznej inteligencji, o tym, co AI może zmienić (a czego raczej nie ruszy), i które systemy robią na Marku największe wrażenie – od Google Maps po infrastrukturę NSA. To szczera, inspirująca rozmowa o tym, jak wygląda świat danych od środka – technicznie, organizacyjnie i... filozoficznie.
Dzień dobry, ja się nazywam Kajo Rudziński, to jest KajoData. Witam na kolejnym wywiadzie. Dzisiaj jest u nas Marek Czuma. Osoba, która powinna się nam wszystkim kojarzyć ze światem Big Data w Polsce. Marek prowadzi wiele różnych inicjatyw, ale dwie najważniejsze, o których chyba warto wspomnieć na początku, to Akademia Big Data i podcast Big Data po polsku, gdzie tych informacji związanych ze światem danych dużych, Danych więcej niż analitycznych jest naprawdę sporo. Marku, dziękuję Ci za Twój czas i przyjęcie zaproszenia. To ja dziękuję za szczyt u Ciebie wystąpić. Bardzo mi miło. Powiem tylko, że w ramach Big Data po polsku danych dużych, ale i małych.
I małych też. Małych też się coraz więcej pojawia. Jakiś czas temu była Klaudia i ona nawet się śmiała, że to jest Big Data. I ona zrobiła screena, przekreśliła Big Data i napisała Small Data u siebie na LinkedIn. No i to jest dobry punkt do wyjścia do naszej rozmowy. To znaczy, ja bym chciał zacząć od tego spektrum tych danych dużych, a może nawet za dużych, bo ostatnio tak często używa się tego porównania, że dane są nowym rodzajem ropy. Które napędzają gospodarkę. My wiemy, że ta ropa też się teoretycznie kiedyś skończy, więc ludzie się próbują przesiąść na inne źródła.
I refleksja, która mnie naszła jest taka, czy danych nie jest za dużo. To znaczy, czy wyobrażasz sobie taką sytuację, w której następuje pewnego rodzaju paraliż i my naprawdę mamy problem, żeby sobie z tym poradzić. Już częściowo tak jest, albo inaczej, tak jest już od dawna i właśnie dlatego powstała branża Big Data. Bo ona nie powstała nie tylko dlatego, że mamy dużo danych, więc się zastanawiamy, o, ale fajnie, mamy takie bogactwo, możemy je jakoś wykorzystać, ale to jest też branża, która jest odpowiedzialna za to, żeby Z tej całej chmury takiego śmieciowiska danych wyłonić perełki, które naprawdę nam są przydatne.
I my na laptopie to piszemy, a potem uruchamiamy na dużym klastrze, czyli zestawie takich maszyn, i on działa dokładnie tak samo, tylko na dużą skalę. I w momencie, w którym tobie brakuje miejsca, faktycznie ty możesz dorzucić nowy node, czyli nowy komputer do tej sieci i ona jest potężniejsza. Ona jest tak jakby, to jest jeden wielki komputer złożony z wielu normalnych. To jest podejście rozproszone. Rozumiem. Podstaw Big Data. Ja jestem ciekawy, bo jak ja cię słucham teraz, to ty jesteś optymistą co do skalowania. W sensie, że jeżeli dobrze rozumiem, tam nie ma sufitu. Są sufity. Ja nie jestem optymistą ani pesymistą. Tutaj raczej tłumaczyłem, na czym polega zasada, która legła u podstaw w ogóle branży Big Data.
Bo podstawowe, takie on-premise'owe, open-source'owe technologie, przede wszystkim Apache Hadoop, który był, można powiedzieć, ekwiwalentem tego, co wymyślili w Google, Google wymyśli kilka technologii, które pozwalały przechowywać dane w trybie rozproszonym i przetwarzać dane w trybie rozproszonym. I te same odpowiedniki tych dokładnie technologii wymyślono potem w fundacji Apache, odwzorowując architektonicznie to, co było w Google i udostępniając na cały świat. I tak powstała branża Big Data. I to jest zasada działania. A pytanie teraz twoje jest takie, czy jest sufit skalowania? Jest i on dotyczy... Sufitów jest kilka, można powiedzieć.
Pierwszy sufit jest technologiczny, czyli dana technologia może być rozmaicie zrobiona. Możemy pracować w trybie rozproszonym, to jest jedno, ale w jaki sposób dokładnie, architektonicznie to zrobić, to już może być zrobione na kilka różnych sposobów. Mamy przykład właśnie Hadoopowej technologii do przechowywania danych, ale takich plików, zupełnie nieustrukturyzowanych, tak jak na komputerze w systemie plików. To jest Hadoop Distributed File System . I on jest tak zbudowany, że faktycznie w pewnym momencie to jest bardzo ciężkie już dalej skalowanie. Możemy dokładać, możemy mieć fizycznie nowe maszyny, ale to już nie będzie to samo.
Microsoft Azure jest jedną z trzech największych chmurowni, dostawców chmur obok AWS'a i Google'a. I on ma bardzo fajną mapkę, gdzie widać wszystkie jego regiony, czyli nawet nie data center, tylko powiedzmy jeszcze poziom wyżej. I mamy kropki, które oznaczają na przykład, że w tym regionie, czyli na przykład w Polsce, jest region Azure'a i on tam ma swoje serwerownie. Mamy oznaczone, gdzie są jakieś infrastrukturalne rzeczy i możemy sobie włączyć taką kropkę, taką opcję, która pokazuje, gdzie on ma różne swoje elektrownie dorzucone. Czyli Azure... Microsoft stawia, i nie tylko on zresztą, na to, żeby samodzielnie generować prąd.
Marek Czuma, KajoDataSpace, Akademia Big Data. Twojemu światowi, światowi Big Data, jest bliżej do programisty niż do analityka. I chciałbym zapytać o to drugie. Gdzie ci jest bliżej? Czy bliżej jest ci do analityka, który czasem sobie coś przejrzy, jakieś wykresy, jakieś tabelki przeskroluje i tak dalej, patrzy, czy joiny dobrze działają? Czy bliżej? Jest ci do programisty, który pisze funkcje, który tam rozkminia, jak robić rzeczy, żeby się działy w dwóch różnych wątkach równocześnie albo wielu równych wątkach równocześnie.
Powiem jeszcze tak. Ja jestem inżynierem danych albo Big Data inżynierem. I to jest stanowisko stricte programistyczne. Ja jestem programistą po prostu, to nie jest... Nie jest tak, że ja jestem inżynierem, więc jestem takim, tak do trzech czwartych mam wymalowanego programistę, w jednej czwartej tam analityka. Jestem programistą. Tylko, że jestem programistą, od którego oczekuje się jeszcze troszkę innych umiejętności albo bardziej szerszego spojrzenia. Bardziej właśnie często architektonicznego, strukturalnego świadomości, na czym polegają różnice na przykład w formatach plików. To są takie rzeczy, o których często się nie myśli, a które mogą mieć duże przełożenie, jeżeli będziemy potem skalować system.
Dlatego, że mam wrażenie, że trochę nam technologia pomaga w tym, żeby dotknąć większej ilości technologii, a rynek wywiera na nas presję, żeby rzeczywiście większą ilość technologii Names mentioned in English. Names mentioned in English. Być kimś takim jak ty, bo domyślam się, że ta ścieżka będzie wyglądała inaczej dla kogoś, kto jest obecnie klasycznym analitykiem, ale go jara właśnie Data Engineering Big Data i klasycznym, powiedzmy, backendowym programistą.
Zupełnie nie od razu. I co więcej, ostatnie moje tygodnie albo nawet miesiące to jest łamanie sobie głowy nad stworzeniem takiego... Można powiedzieć podproduktu w ramach Akademii, gdzie będzie bardzo laserowo skierowany do programisty webowego właśnie, żeby go przeprowadzić kroczek po kroczku, ale w dość zautomatyzowany sposób do inżyniera danych. Dlatego, że programista, który robi już w aplikacjach webowych, ale sądzę, że mobilnych to jest z grubsza to samo, Ma moim zdaniem dość prostą ścieżkę rozwoju. Prostą to nie znaczy szybką, ale jest to, ma naprawdę potężny fundament do tego, żeby wejść tam.
Bardzo Ci dziękuję za to sprecyzowanie. To jest, myślę, o tyle ważne, że dla osób, wiesz, ja się poruszam w jakiejś tam analitycznej bańce i dla osób, które słyszą słowo czy frazę inżynier danych, big data, to oni mają takie poczucie, no ja jestem data analyst, on jest big data, to w zasadzie będę robił to samo, tylko na większych tabelach, więc jest nam pewnie ekstremalnie blisko. Tymczasem z tego, jak ja Cię słucham, To nie jest nam blisko, to jest nam jednak dosyć bliżej, tak jak wspomniałeś, jesteś bardziej programistą niż analitykiem, w związku z tym moja droga będzie dłuższa do ciebie niż powiedzmy przeciętnego programisty prawdopodobnie. Tak, tak, to absolutnie tak, dlatego że każdy programista z założenia powinien myśleć po inżyniersku.
No dobrze, to zamykając na moment wątek sztucznej inteligencji, chciałem wrócić do świata Big Data, bo zazwyczaj jak się rozmawia z takimi ludźmi jak ty, czy też jak są takie wywiady, że się właśnie zaprasza kogoś, to bardzo popularnym wątkiem jest jak się dostać i czego się nauczyć i tak dalej, i tak dalej. A ja bym chciał teraz zadać pytanie od drugiej strony, to znaczy... Nie, nie, nie, nie, nie, nie. Jak być najlepszym? Jak być rewelacyjnym inżynierem? Czyli ja już pracuję z Big Data, jakby co ci imponuje? Co jest czymś takim, gdzie wiesz, to wiadomo, że to nie jest do juniorów czy do midów, to jest takie, że ja już ogarniam, jest nieźle, ale jak ty sobie myślisz o na przykład sobie za pięć lat w takiej wersji ultra, że jesteś po prostu świetny, jesteś rewelacyjny,
To co tam jest? To tu od razu postaram się na to pytanie odpowiedzieć na bieżąco, ale od razu powiem, że był odcinek podcastu, gdzie poświęciłem całe dokładnie temu zagadnieniu i tam się dokładniej z tego przygotowałem. To znaczy, to trzeba mieć, żeby zostać takim super ekspertem w inżynierii danych, takim, gdzie pracujesz dla big techów i gdzie, wiesz, wymiatasz ten... Podlinkujemy pod odcinkiem. Tak, to jest tam 46 chyba, czy ileś tam numer odcinka. Przede wszystkim pierwsza rzecz taka podstawowa zupełnie to umiejętność świetnego, tego paradoksalnie zwykle się o tym nie mówi, ale świetna umiejętność obsługi technicznej tych technologii, które mamy.
Zobaczmy, że ty widzisz pewnego rodzaju części składowe, czyli na przykład będę miał okienko danych, które się przesuwa, jedna rzecz. Unikalność klientów, druga rzecz. I już tu ci się zaczynają układać pewnego rodzaju klocki. Czy to jest tak, że w świecie Big Data też są pewnego rodzaju klocki, że wchodzisz do nowej firmy? I pytasz, jak oni to mają ułożone i widzisz sobie, a, okej, dobra, czyli pliki trzymacie w ten sposób, tutaj sieć jest ułożona w ten sposób, dostawca jest taki i ty z tych klocków jakby nie musisz rzeźbić od zera linijka po linijce, tylko to są takie większe klocki? Oczywiście. Im więcej masz doświadczenia, tym pewnie więcej też widzisz tych różnych wzorców.
Więc ja raczej miałem już tą komfortową sytuację w każdym z projektów, że wiedzieliśmy z jaką materią się mierzymy na start. Rozumiem. Super. Marek, bardzo ci dziękuję za tą taką przekrojową rozmowę i mam nadzieję, że nieco ciekawszą niż standardowe, że tak powiem, jak, czego się uczyć na początku. Gdyby ktoś się chciał znaleźć i poszukać w internecie czegoś się więcej dowiedzieć o ciebie albo o świecie Big Data, to gdzie może to zrobić? Podcast Big Data po polsku, jeżeli kogoś interesują takie ogólne informacje, ktoś tak jest ciekawym świata człowiekiem i chce posłuchać sobie o świecie, który jest zbudowany z danych, no to właśnie o takich rzeczach mówiłem.
Ostatnio miałem tam odcinek na temat dronów też, systemów dronowych, jak o fabrykach, gigantycznych fabrykach latających danych. Więc jak kogoś takie miękkie informacje interesują, to Big Data po polsku, podcast. A jak ktoś chce wejść już tak na twardo, to Akademia Big Data. Tam macie taki pakiet startowy za zero złotych, gdzie można naprawdę dużo wiedzy też wyciągnąć takiej wstępnej. No i potem Akademia na YouTubie też znajdziecie, także Big Data po polsku i Akademia Big Data. Super. Materiały będą podlinkowane pod odcinkiem. Marek, jeszcze raz bardzo ci dziękuję za twój czas. To ja bardzo dziękuję i życzę powodzenia wszystkim naszym słuchaczom gdziekolwiek, czy w Analizie, czy w Big Data, czy gdziekolwiek będzie.
Pokazano wszystkie 17 dopasowań. Transkrypcja generowana automatycznie i niesprawdzana ręcznie — może zawierać błędy.
Kliknij, aby znaleźć fragmenty, w których pada.
KajoData:
🟨 Społeczność analityków KajoDataSpace
🟦 Kursy - Excel, Power Query, SQL, PowerBI, Python, Tableau
Marek Czuma
🟩 Akademia Big Data
🟫 Big Data Po Polsku
W tym odcinku spotkałem się z Markiem Czumą – inżynierem danych, twórcą Akademii Big Data i podcastu „Big Data po polsku”. To rozmowa o świecie ogromnych zbiorów danych, technologii rozproszonych i granicach tego, co możemy dziś przetworzyć. Zaczynamy od pytania, czy danych nie jest po prostu za dużo – i czy w tej „danej ropie XXI wieku” nie zaczynamy się powoli topić. Marek tłumaczy, jak naprawdę wygląda branża Big Data, na czym polega przetwarzanie rozproszone i dlaczego dodanie „kolejnych serwerów” nie zawsze rozwiązuje problem.
Rozmawiamy też o różnicach między analitykiem danych a inżynierem danych – gdzie kończy się Excel, a zaczyna Apache Spark. Marek pokazuje, że Big Data to nie tylko programowanie, ale sposób myślenia – inżynierski, systemowy, zrozumiały dopiero wtedy, gdy wiesz, co dzieje się „pod spodem”.
Zastanawiamy się też, jak wygląda ścieżka rozwoju od analityka do inżyniera danych i które umiejętności są tu naprawdę kluczowe.
W drugiej części schodzimy na meta-poziom – rozmawiamy o przyszłości zawodów IT w erze sztucznej inteligencji, o tym, co AI może zmienić (a czego raczej nie ruszy), i które systemy robią na Marku największe wrażenie – od Google Maps po infrastrukturę NSA. To szczera, inspirująca rozmowa o tym, jak wygląda świat danych od środka – technicznie, organizacyjnie i... filozoficznie.