Wprowadzenie

Czym jest ETL?

Ta strona wyjaśnia, od samego początku i potocznym językiem, co oznacza „ETL”, dlaczego duża firma go potrzebuje oraz gdzie w to wszystko wpisuje się platforma DataFlow AI. Aby ją przeczytać, nie potrzebujesz żadnego przygotowania technicznego — każde specjalistyczne słowo jest wyjaśniane przy pierwszym pojawieniu się.


Zacznijmy od prostego problemu

Wyobraź sobie bardzo dużą firmę — na przykład Polkomtel, firmę stojącą za siecią telefonii komórkowej „Plus” w Polsce. Jak każde duże przedsiębiorstwo, Polkomtel nie przechowuje wszystkich swoich informacji w jednym miejscu. Zamiast tego różne części firmy prowadzą własne ewidencje, w swoich własnych szafach na dokumenty, na swój własny sposób.

Oto cztery z tych „szaf na dokumenty”:

  • System relacji z klientami (często skracany do CRM, co oznacza po prostu oprogramowanie śledzące klientów) przechowuje imiona i nazwiska ludzi, ich dane kontaktowe oraz podpisane przez nich umowy.
  • System billingowy przechowuje faktury oraz zapisy płatności.
  • Przełączniki sieciowe — potężne komputery wewnątrz sieci telefonicznej — zapisują rekord każdego pojedynczego połączenia telefonicznego oraz każdej sesji internetowej. Każdy z tych rekordów nazywany jest Rekordem Szczegółów Połączenia, w skrócie CDR. Pomyśl o CDR jak o maleńkim paragonie, który mówi „ten numer telefonu zadzwonił do tamtego numeru telefonu, o tej godzinie, na tyle a tyle sekund”.
  • Narzędzia raportowania sprzedaży przechowują dane o przychodach — ile pieniędzy firma zarabia.

Teraz wyobraź sobie osobę, której zadaniem jest analizowanie biznesu — analityka biznesowego — która chce odpowiedzieć na jedno z pozoru proste pytanie:

„Którzy z naszych klientów najprawdopodobniej odejdą od nas i przejdą do konkurencji w przyszłym miesiącu?”

Tej odpowiedzi nie da się uzyskać z żadnej pojedynczej szafy na dokumenty. Aby ją wypracować, analityk musi połączyć szczegóły umowy klienta (z CRM), jego historię płatności (z systemu billingowego), to, jak intensywnie ostatnio korzystał z telefonu (z CDR-ów) i więcej. Informacje są rozproszone, a każdy system „mówi innym językiem” — co oznacza, że każdy z nich przechowuje swoje dane przy użyciu innej technologii i innego układu.

To jest właśnie problem, który rozwiązuje ETL. ETL to zautomatyzowana instalacja hydrauliczna, która zbiera rozproszone informacje razem, dzięki czemu na pytania takie jak powyższe można rzeczywiście odpowiedzieć.

Mówiąc prościej

ETL to działający w tle proces, który kopiuje informacje z wielu odrębnych systemów komputerowych, porządkuje je i zbiera w jednym miejscu, gdzie można je analizować. Bez niego każde interesujące pytanie biznesowe wymagałoby od człowieka ręcznego otwierania kilkunastu systemów i ręcznego kopiowania danych do arkusza kalkulacyjnego — każdego dnia.


Co oznaczają te trzy litery

ETL oznacza trzy kroki, które odbywają się po kolei: Extract (Wyodrębnij), Transform (Przekształć), Load (Załaduj).

Dobrym sposobem na wyobrażenie sobie całego procesu jest myślenie o gotowaniu posiłku:

  1. Extract to pobieranie składników z różnych szafek, lodówki i spiżarni.
  2. Transform to przygotowywanie składników — mycie, obieranie, krojenie, mieszanie i gotowanie ich, aż staną się gotowym daniem.
  3. Load to podawanie gotowego dania na talerz, aby ludzie mogli je zjeść.

Przejdźmy przez każdy z kroków porządnie, posługując się przykładem firmy telekomunikacyjnej.

Extract — „Skopiuj surowe dane na zewnątrz”

Pierwszym krokiem jest Extract. Oznacza to połączenie się z jednym z systemów źródłowych — powiedzmy z bazą danych billingu — i odczytanie kopii potrzebnych wierszy danych.

Słowo „kopia” ma znaczenie. Extract nie zmienia niczego w oryginalnym systemie i nie przenosi z niego danych. Po prostu odczytuje duplikat. Jest to celowe: system billingowy jest zajęty wykonywaniem swojej prawdziwej pracy (wysyłaniem faktur do klientów) i nie wolno nam mu przeszkadzać.

Przydatny przykład z telekomunikacji: każdej nocy proces wyodrębnia rekordy połączeń, które przełączniki sieciowe zapisały w ciągu poprzedniego dnia — pobierając kopię każdego „paragonu” każdego połączenia i sesji danych.

W platformie DataFlow AI ten krok wykonywany jest przez element konstrukcyjny zwany Konektorem Źródłowym (słowo „konektor” jest szczegółowo wyjaśnione poniżej). Mówisz Konektorowi Źródłowemu, z którego systemu ma czytać, którą tabelę danych chcesz oraz — opcjonalnie — możesz dodać filtr taki jak „daj mi tylko wczorajsze rekordy”, abyś niepotrzebnie nie kopiował danych, które już masz.

Transform — „Wyczyść je i przekształć”

Surowe dane, świeżo wyodrębnione, niemal nigdy nie są gotowe do użycia. Są nieuporządkowane, w taki sam sposób jak warzywa prosto z ogrodu są pokryte ziemią. Typowe problemy obejmują:

  • Brakujące wartości — na przykład rekord klienta bez wypełnionego adresu e-mail.
  • Niespójne formaty — ten sam numer telefonu zapisany na pięć różnych sposobów w pięciu systemach (z kodem kraju, bez niego, ze spacjami, z myślnikami i tak dalej).
  • Duplikaty — ten sam klient przypadkowo wprowadzony do systemu dwukrotnie.
  • Dane rozproszone w wielu tabelach, które trzeba połączyć (złączyć) — zszyć razem — zanim nabiorą sensu. Imię i nazwisko klienta może być w jednej tabeli, a jego płatności w innej; aby zobaczyć je obok siebie, obie tabele trzeba dopasować na podstawie wspólnego identyfikatora, takiego jak numer klienta.

Krok Transform naprawia to wszystko. To tu dane są czyszczone, korygowane, łączone i przekształcane w jedną spójną, uporządkowaną postać.

W DataFlow AI krok Transform wykonuje się przez przeciąganie małych elementów konstrukcyjnych zwanych węzłami transformacji na płótno projektowe. Każdy węzeł wykonuje jedno konkretne zadanie. Główne z nich to:

Węzeł transformacjiCo robi, mówiąc prosto
FilterOdrzuca wiersze, których nie chcesz — na przykład „usuń każdy rekord testowy”.
ExpressionOblicza nową wartość lub przeformatowuje istniejącą — na przykład przekształcając każdy numer telefonu w jeden standardowy format.
JoinerZszywa dwie tabele razem na podstawie wspólnego klucza, dzięki czemu powiązane informacje znajdują się obok siebie.
AggregatorPodsumowuje wiele wierszy do mniejszej liczby — na przykład „łączna sprzedaż na region” zamienia tysiące pojedynczych sprzedaży w jedną liczbę na region.
RouterKieruje wiersze różnymi ścieżkami w zależności od ich zawartości.
SorterUstawia wiersze w wybranej kolejności.
UnionSkłada wiersze z kilku źródeł w jeden połączony zbiór.
Sequence GeneratorTworzy świeży, kolejny numer dla każdego wiersza, przydatny jako unikalny identyfikator.

Szczególnie ważnym zadaniem transformacji w firmie telekomunikacyjnej jest maskowanie — celowe ukrywanie wrażliwych danych osobowych. Polska używa krajowego numeru tożsamości zwanego PESEL, a same numery telefonów są danymi osobowymi. Podczas kroku Transform wartości te mogą zostać zamaskowane (na przykład zastąpione przez ********), tak aby wrażliwe szczegóły nigdy nie trafiły do końcowych raportów, które może zobaczyć zwykły personel.

Load — „Umieść gotowe dane w hurtowni”

Ostatnim krokiem jest Load. Wyczyszczone, połączone, uporządkowane dane są teraz zapisywane do swojego miejsca docelowego — centralnego systemu zaprojektowanego do analiz. To miejsce docelowe nazywane jest zwykle hurtownią danych.

Hurtownia danych to specjalny rodzaj bazy danych zbudowany nie do codziennego prowadzenia biznesu, lecz do zadawania pytań o biznes. Tam gdzie system billingowy jest zoptymalizowany pod szybkie wysłanie jednej faktury, hurtownia danych jest zoptymalizowana pod skanowanie milionów rekordów w celu wytworzenia raportu. Powszechne produkty hurtowni danych, o których usłyszysz w tej dokumentacji, to Snowflake, Teradata i Databricks.

Gdy dane zostaną załadowane do hurtowni, narzędzia raportowania analityka — często nazywane narzędziami Business Intelligence, w skrócie BI — mogą wreszcie je odpytać i wytworzyć pulpity oraz odpowiedzi, których potrzebuje biznes.

W DataFlow AI ten krok wykonywany jest przez element konstrukcyjny zwany Konektorem Ujścia. („Ujście”, ang. „sink”, to standardowe słowo ETL oznaczające miejsce docelowe — miejsce, do którego dane wpływają, przeciwieństwo źródła). Konfigurując Konektor Ujścia, musisz wybrać tryb zapisu, który mówi platformie, jak zapisać nowe dane:

Tryb zapisuCo robi
AppendDodaje nowe wiersze obok istniejących, zachowując wszystko.
OverwriteOdrzuca wszystko, co tam było, i zastępuje to całkowicie.
Upsert (zwany też Merge)Aktualizuje wiersze, które już istnieją, i wstawia wiersze, które są nowe. To najczęstszy wybór przy codziennym odświeżaniu.
Delete-InsertUsuwa zdefiniowany wycinek danych (na przykład „wszystkie wczorajsze rekordy”), a następnie wstawia ten wycinek na nowo.

Słowo upsert to połączenie „update” i „insert” — robi oba naraz, decydując wiersz po wierszu, który z nich jest potrzebny.

Mówiąc prościej

Extract = skopiuj surowe dane na zewnątrz. Transform = wyczyść je i połącz. Load = zapisz gotowy wynik do hurtowni, gdzie można go analizować. ETL to po prostu te trzy kroki, wykonywane automatycznie, raz za razem, według harmonogramu.


ELT — te same litery w innej kolejności

Możesz spotkać się również z terminem ELT — te same trzy słowa, ale z zamienionymi miejscami Load i Transform: Extract, Load, Transform.

Różnica polega na tym, gdzie odbywa się czyszczenie. W klasycznym ETL dane są przekształcane po drodze do hurtowni, przez samą platformę ETL. W ELT surowe dane są najpierw ładowane do potężnej hurtowni, a transformacja jest następnie wykonywana wewnątrz tej hurtowni, przy użyciu silnika samej hurtowni.

Dlaczego ktokolwiek miałby robić to w ten sposób? Ponieważ nowoczesne hurtownie danych są niezwykle wydajne. Jeśli hurtownia potrafi wykonać ciężkie czyszczenie szybciej niż platforma ETL, to wyciąganie wszystkich danych, czyszczenie ich gdzie indziej i odsyłanie z powrotem jest marnotrawstwem.

DataFlow AI robi to automatycznie dzięki funkcji zwanej Silnikiem SQL Push-Down. Zamiast wyciągać miliony wierszy z bazy danych, aby je przekształcić, platforma przepisuje twoją transformację jako instrukcję w SQL — standardowym języku, który bazy danych rozumieją — i wysyła do bazy danych jedynie tę krótką instrukcję, polecając jej, aby sama wykonała pracę, tam gdzie dane już się znajdują. Duże ilości danych nigdy zatem nie muszą podróżować przez sieć. Platforma podaje, że w ten sposób potrafi „zepchnąć w dół” ponad 90% standardowej pracy analitycznej, w 8 różnych dialektach baz danych (dialekt to konkretna odmiana SQL właściwa danej bazie danych).

Mówiąc prościej

ELT to ETL z czyszczeniem wykonywanym wewnątrz hurtowni zamiast po drodze do niej. DataFlow AI wybiera szybszą opcję automatycznie, wysyłając pracę tam, gdzie dane już się znajdują, zamiast przeciągać dane do pracy.


Czym jest „potok danych”?

Do tej pory mówiliśmy o krokach. Kompletna, kompleksowa sekwencja kroków — wyodrębnij to, przekształć tak a tak, załaduj tam — nazywana jest potokiem danych.

Potok danych najlepiej traktować jako przepis. Gdy już zapiszesz przepis, nie musisz już o nim myśleć: może być uruchamiany automatycznie, każdej nocy, bez czyjegokolwiek nadzoru. Pojedynczy potok danych mówi w istocie:

„Weź rekordy połączeń i tabelę klientów z tych systemów, usuń wiersze testowe, zamaskuj numery PESEL, połącz te dwa zbiory razem, podsumuj według regionu i zapisz wynik do hurtowni Snowflake”.

W DataFlow AI potok danych jest rysowany jako diagram połączonych pudełek. Każde pudełko to węzeł (jeden krok), a strzałki między pudełkami to krawędzie (pokazują kolejność, w jakiej kroki się wykonują, oraz który krok zasila który). Ten diagram pudełek i strzałek ma formalną nazwę: DAG.

DAG oznacza Directed Acyclic Graph (Skierowany Graf Acykliczny). To brzmi onieśmielająco, więc oto rozłożenie tego na czynniki:

  • Graf — zbiór pudełek połączonych strzałkami.
  • Skierowany — strzałki wskazują jeden kierunek; dane płyną w określonym kierunku.
  • Acykliczny — nie ma pętli. Nigdy nie możesz podążać za strzałkami i wrócić tam, skąd zacząłeś. To gwarantuje, że potok danych zawsze się kończy i nigdy nie goni w nieskończoność własnego ogona.

Tak więc „potok danych to DAG” oznacza po prostu „potok danych to jednokierunkowy schemat blokowy kroków bez pętli”.

   ┌──────────┐     ┌──────────┐     ┌────────────┐     ┌──────────┐
   │  Source  │ ──▶ │  Filter  │ ──▶ │  Aggregator│ ──▶ │   Sink   │
   │ (Extract)│     │ (drop    │     │ (summarise │     │  (Load)  │
   │          │     │  test    │     │  by region)│     │          │
   └──────────┘     │  rows)   │     └────────────┘     └──────────┘
                    └──────────┘
        a pipeline drawn as a DAG — boxes are nodes, arrows are edges

Wsadowo kontra strumieniowo — dwie prędkości ETL

Potok danych może działać z jedną z dwóch bardzo różnych prędkości. DataFlow AI obsługuje obie.

Wsadowo — „zrób to wszystko naraz, według harmonogramu”

Potok danych wsadowy działa według grafiku — na przykład każdej nocy o godzinie 2:00. Gdy nadejdzie jego pora, budzi się, przetwarza jedną dużą „partię” danych naraz (powiedzmy wszystkie wczorajsze rekordy połączeń), zapisuje wynik, a następnie wraca do snu aż do jutra.

Wsadowo to właściwy wybór dla nocnych ładowań hurtowni, dziennych lub tygodniowych raportów podsumowujących oraz importowania plików. To najczęstszy rodzaj potoku danych.

Strumieniowo — „rób to ciągle, w chwili gdy dane przybywają”

Potok danych strumieniowy nigdy nie śpi. Działa nieprzerwanie, 24 godziny na dobę, i przetwarza każdy nowy rekord w ciągu sekund od pojawienia się tego rekordu. Tam gdzie wsadowo jest jak opróżnianie skrzynki pocztowej raz dziennie, strumieniowo jest jak taśmociąg, który niesie każdy list dalej w chwili, gdy ten się pojawia.

Strumieniowo to właściwy wybór, gdy liczy się świeżość: utrzymywanie kopii zapasowej bazy danych idealnie zsynchronizowanej z oryginałem w czasie rzeczywistym, reagowanie na zdarzenia sieciowe w miarę jak przełączniki je wytwarzają lub zasilanie pulpitów na żywo.

Potoki strumieniowe DataFlow AI są napędzane przez dwie dobrze znane technologie open-source: Apache Flink (silnik wyspecjalizowany w przetwarzaniu ciągłych przepływów danych) oraz Debezium (narzędzie obserwujące bazy danych pod kątem zmian — wyjaśnione w dalszej części).

WsadowoStrumieniowo
Jak często działaWedług harmonogramu (np. co noc)Nieprzerwanie, nigdy się nie zatrzymuje
Jak świeże są daneTak świeże jak ostatnie zaplanowane uruchomienieSprzed sekund
Typowe zastosowanieNocne ładowania hurtowni, raporty, importy plikówReplikacja na żywo, przetwarzanie zdarzeń w czasie rzeczywistym
Napędzane przezZaplanowane zadania na silniku SparkApache Flink + Debezium

Czym jest „przechwytywanie zmian danych” (CDC)?

Strumieniowanie rodzi praktyczne pytanie: skąd potok danych wie, sekunda po sekundzie, że coś w źródłowej bazie danych się zmieniło? Niezgrabnym sposobem byłoby ponowne skanowanie całej tabeli raz za razem w poszukiwaniu różnic. Dla tabeli z milionami wierszy jest to beznadziejnie powolne i marnotrawne.

Sprytny sposób nazywa się przechwytywaniem zmian danych (Change Data Capture), niemal zawsze skracanym do CDC.

Każda poważna baza danych prowadzi prywatny wewnętrzny dziennik — zwany dziennikiem transakcji — w którym zapisuje każdą zmianę, jaką wprowadza: każdy wstawiony wiersz, każdy zaktualizowany wiersz, każdy usunięty wiersz. Baza danych prowadzi ten dziennik dla własnych celów bezpieczeństwa i odzyskiwania.

CDC działa poprzez odczytywanie tego dziennika. Zamiast ponownie skanować całą tabelę, narzędzie CDC po prostu obserwuje dziennik transakcji i podejmuje każdą zmianę w chwili, gdy baza danych ją odnotowuje. To różnica między ponownym przeliczaniem każdej książki w bibliotece co godzinę a po prostu staniem przy ladzie i odnotowywaniem każdej książki w chwili, gdy jest wypożyczana lub zwracana.

DataFlow AI zapewnia CDC za pośrednictwem narzędzia Debezium i obsługuje je dla pięciu typów baz danych: Oracle, PostgreSQL, Microsoft SQL Server, MySQL i MongoDB. Przechwycone zmiany docierają zazwyczaj do miejsca docelowego w niecałe 5 sekund.

Mówiąc prościej

CDC oznacza „obserwuj własny dziennik zmian bazy danych i podejmuj każdą edycję w chwili, gdy się pojawia” — zamiast wielokrotnego ponownego odczytywania całej tabeli, aby wypatrzyć, co jest nowe. To właśnie czyni strumieniowanie w czasie rzeczywistym szybkim i przystępnym cenowo.


Czym jest „konektor”?

Użyliśmy słowa konektor kilkukrotnie. Oto pełne wyjaśnienie.

Każdy system źródłowy i każdy system docelowy jest inny. Baza danych Oracle, folder plików CSV, strumień Apache Kafka oraz hurtownia Snowflake — każde z nich „mówi innym językiem” i trzeba się z nimi komunikować w ich własny, szczególny sposób — z ich własną metodą logowania, ich własnymi poleceniami, ich własnymi osobliwościami.

Konektor to gotowy adapter — fragment oprogramowania, który już wie, jak komunikować się z jednym konkretnym rodzajem systemu. Pomyśl o adapterach podróżnych, które pakujesz na wakacje: jeden kształt wtyczki dla Wielkiej Brytanii, inny dla Europy, jeszcze inny dla USA. Konektor to dokładnie to, ale dla systemów danych. Pozwala DataFlow AI podłączyć się do bazy danych, magazynu plików lub systemu strumieniowego bez konieczności znajomości technicznych szczegółów tego systemu.

DataFlow AI dostarczany jest z dużą biblioteką konektorów, obejmującą:

  • Bazy danych: Oracle, PostgreSQL, Microsoft SQL Server, MySQL, Teradata, SAP HANA, Sybase ASE, MongoDB.
  • Chmurowe hurtownie danych: Snowflake, Databricks, Google BigQuery.
  • Pliki: CSV (i inny tekst rozdzielany znakami), Excel, JSON, Parquet, XML.
  • Strumieniowanie: Apache Kafka oraz konektor przechwytywania zmian danych oparty na Debezium.
  • Aplikacje biznesowe: Salesforce, SAP ERP, ServiceNow oraz uniwersalny konektor dla dowolnego REST API.
  • Konektor specyficzny dla telekomunikacji do odczytywania Rekordów Szczegółów Połączeń w ich szczególnym formacie binarnym — funkcja zbudowana specjalnie dla Polkomtela.

Gdy administrator skonfiguruje konektor (wprowadzając adres systemu i dane logowania, które są następnie bezpiecznie przechowywane i nigdy więcej nie pokazywane), konektor ten staje się wielokrotnie używalnym elementem konstrukcyjnym, który pojawia się w projektancie potoków danych, gotowy do przeciągnięcia na płótno.


Kilka kolejnych słów, które napotkasz

Te terminy pojawiają się w całym DataFlow AI. Oto przystępna definicja każdego z nich.

Schemat

Schemat to kształt zbioru danych — lista jego kolumn oraz to, jaki rodzaj wartości przechowuje każda kolumna. Dla tabeli klientów schemat mógłby wyglądać tak: kolumna o nazwie name przechowująca tekst, kolumna o nazwie date_of_birth przechowująca datę oraz kolumna o nazwie balance przechowująca liczbę. Schemat to plan; wiersze to faktyczne dane wlane do tego planu. Gdy plan się zmienia — na przykład dodawana jest nowa kolumna — nazywa się to ewolucją schematu, a dobra platforma ETL potrafi sobie z tym poradzić w sposób płynny.

Pochodzenie danych

Pochodzenie danych to drzewo genealogiczne fragmentu danych. Odpowiada na pytanie: „Skąd wzięła się ta liczba i co po drodze z nią zrobiono?”

Jeśli raport pokazuje „całkowity przychód regionu warszawskiego”, pochodzenie danych pozwala prześledzić tę jedną liczbę wstecz: została zsumowana z tych wierszy, które zostały złączone z tych dwóch tabel, które zostały wyodrębnione z tych dwóch systemów źródłowych, z tymi transformacjami zastosowanymi na każdym kroku. DataFlow AI potrafi prześledzić pochodzenie danych aż do poziomu pojedynczej kolumny — pokazując na przykład, że kolumna hurtowni CUST_ID została wytworzona przez wzięcie kolumny źródłowej id, przycięcie spacji i przekształcenie jej na wielkie litery.

Pochodzenie danych jest bezcenne z dwóch powodów. Po pierwsze, zaufanie: gdy ktoś pyta „czy możemy wierzyć tej liczbie?”, pochodzenie danych pokazuje dokładnie, jak została zbudowana. Po drugie, analiza wpływu: zanim zmienisz system źródłowy, możesz zapytać „które raporty w dół zależą od tego?” i zobaczyć wszystko, na co miałoby to wpływ.

Jakość danych

Jakość danych to miara tego, na ile godny zaufania i nadający się do użytku jest zbiór danych. Dane niskiej jakości — pełne luk, duplikatów i niemożliwych wartości — prowadzą do złych decyzji biznesowych.

DataFlow AI zawiera silnik jakości danych, który sprawdza dane względem zdefiniowanych przez ciebie reguł. Reguła mogłaby mówić „kolumna e-mail nigdy nie może być pusta”, albo „kolumna wieku musi mieścić się między 0 a 120”, albo „każdy identyfikator klienta w tabeli zamówień musi istnieć również w tabeli klientów”. Każdemu zbiorowi danych przyznawany jest następnie wynik jakości — pojedyncza liczba, zazwyczaj w skali do 100 — dzięki czemu każdy może na pierwszy rzut oka zobaczyć, jak niezawodny on jest.

Zarządzanie danymi

Zarządzanie danymi to zestaw reguł, zatwierdzeń i kontroli, które zapewniają, że dane są obsługiwane poprawnie i zgodnie z prawem — zwłaszcza wrażliwe dane osobowe. Ponieważ Polkomtel obsługuje dane osobowe milionów abonentów, musi przestrzegać surowych przepisów, w szczególności europejskiego rozporządzenia o ochronie danych GDPR (w Polsce znanego jako RODO). Funkcje zarządzania danymi zapewniają na przykład, że dane osobowe są maskowane tam, gdzie powinny, że są usuwane, gdy klient o to wnioskuje, oraz że ktoś z upoważnieniem zatwierdza potok danych, zanim zostanie on uruchomiony produkcyjnie.


Dlaczego firmy potrzebują ETL

Zbierając to wszystko razem, oto dlaczego firma taka jak Polkomtel nie może funkcjonować bez ETL:

  • Dane są rozproszone. Żaden pojedynczy system nie zawiera całego obrazu. Tylko poprzez łączenie systemów można odpowiedzieć na ważne pytania.
  • Systemów nie wolno zakłócać. Systemy billingowe i sieciowe mają krytyczną codzienną pracę. ETL pobiera kopie i pracuje na tych kopiach, pozostawiając oryginały nietknięte.
  • Surowe dane są nieuporządkowane. Dane z prawdziwego świata są pełne luk, duplikatów i niespójności. Muszą zostać wyczyszczone, zanim będzie można im zaufać.
  • Musi to odbywać się automatycznie i powtarzalnie. Raporty są potrzebne każdego dnia. Proces ręczny byłby powolny, podatny na błędy i niemożliwy do skalowania. Potok danych, raz napisany, uruchamia się sam.
  • Musi być możliwe do prześledzenia i zgodne z prawem. Regulatorzy i audytorzy żądają wiedzy o tym, skąd pochodzą dane i jak chronione są informacje osobowe. Platformy ETL rejestrują pochodzenie danych i egzekwują reguły zarządzania danymi.

Gdzie wpisuje się DataFlow AI

DataFlow AI to platforma ETL i ELT zbudowana przez firmę software'ową auraliscode sp. z o.o specjalnie dla Polkomtela (telekomu „Plus” w Polsce), w ramach projektu modernizacji centralnej hurtowni danych firmy.

To, co ją wyróżnia, to cel uczynienia ETL użytecznym nie tylko dla wyspecjalizowanych inżynierów, ale również dla osób nietechnicznych. Robi to na kilka sposobów:

  • Wizualny projektant typu „przeciągnij i upuść”. Budujesz potok danych, przeciągając pudełka na płótno i łącząc je strzałkami — bez konieczności programowania.
  • AI Copilot. Możesz opisać, czego chcesz, prostym językiem angielskim (lub prostą polszczyzną) — na przykład „załaduj wczorajszą sprzedaż z Oracle do Snowflake i usuń rekordy testowe” — a asystent AI naszkicuje dla ciebie potok danych.
  • Komunikaty o błędach w przystępnym języku. Gdy coś pójdzie nie tak, platforma wyjaśnia problem potocznymi słowami i sugeruje rozwiązanie, zamiast wypisywać zagadkowy błąd techniczny.
  • Interfejs dostosowujący się do roli. Ekran dostosowuje się w zależności od tego, kim jesteś — inżynierem, analitykiem, opiekunem danych czy administratorem — pokazując tylko te elementy sterowania, które są istotne dla twojej pracy.

W skrócie: ETL to uniwersalny problem przenoszenia i porządkowania danych, tak aby biznes mógł z nich korzystać. DataFlow AI to platforma, która ten problem rozwiązuje i bardzo się stara uczynić to rozwiązanie przystępnym dla każdego, nie tylko dla specjalistów.

Następna strona, Jak DataFlow AI realizuje ETL, podnosi pokrywę i pokazuje krok po kroku, jak platforma faktycznie wykonuje wszystko, co tu opisano.

Poprzednia
Pierwsze kroki