Przewodniki po funkcjach
Przeglądarka danych i katalog
Przeglądarka danych to warstwa odkrywania i ładu danych platformy DataFlow AI. Prezentuje katalog oparty na OpenMetadata, który pozwala przeszukiwać, eksplorować i rozumieć każdą tabelę, kolumnę i zbiór danych w heterogenicznym majątku danych Polkomtela — Teradata DWH-MONA, Snowflake, SAP HANA, Databricks oraz MSSQL/Sybase. Jest skoncentrowana na wyszukiwaniu i widoczna pod kątem ładu danych: znaczniki PII, plakietki certyfikacji i oceny jakości są zawsze wyświetlane.
Nowy tutaj? Czym jest „katalog danych"
Duża firma jak Polkomtel przechowuje dane w dziesiątkach różnych baz danych. Nikt nie jest w stanie zapamiętać, co jest we wszystkich z nich. Katalog danych rozwiązuje ten problem — jest przeszukiwalnym katalogiem każdej tabeli i kolumny, jaką firma posiada, niezależnie od tego, w której bazie danych się znajduje. Pomyśl o nim jak o katalogu bibliotecznym danych firmy: przeszukujesz go, aby znaleźć to, czego potrzebujesz, a następnie czytasz jego „kartę", aby zrozumieć, co znalazłeś.
Przeglądarka danych jest tym katalogiem. Dzięki niej możesz:
- Wyszukiwać dane według słowa kluczowego — wpisz „churn" i zobacz każdą powiązaną tabelę we wszystkich systemach.
- Przeglądać dane pogrupowane według obszaru biznesowego (Klienci, Rozliczenia, Sieć i tak dalej).
- Rozumieć tabelę, zanim jej użyjesz — zobacz jej kolumny, próbkę rzeczywistych wierszy oraz statystyki.
- Ufać jej — zobacz, czy została sprawdzona pod kątem jakości i certyfikowana oraz czy zawiera dane prywatne.
- Śledzić skąd dany element danych pochodzi i dokąd przepływa.
Kilka słów, które zobaczysz na tych ekranach:
- Tabela — siatka danych, jak zakładka arkusza kalkulacyjnego. Kolumny to jej pola (np.
FIRST_NAME); wiersze to jej rekordy (jeden na klienta). - Schemat — nazwana grupa powiązanych tabel wewnątrz bazy danych.
- PII — Personally Identifiable Information (informacje umożliwiające identyfikację osoby): dane, które identyfikują rzeczywistą osobę (imię i nazwisko, numer telefonu). Są oznaczone specjalnym znacznikiem, ponieważ muszą być obsługiwane ostrożnie.
- Certyfikowana — plakietka oznaczająca, że opiekun danych przejrzał tabelę i poręcza, że jest wiarygodna.
- Pochodzenie danych — udokumentowana droga danych, pokazująca, skąd pochodzą wartości tabeli i co z niej wypływa.
- Profilowanie — automatyczne statystyki o kolumnie: ile wierszy jest pustych, ile ma odrębnych wartości, jaka jest najmniejsza i największa wartość i tak dalej.
Bez konieczności zgłaszania do działu inżynierii
Cały sens Przeglądarki danych to samoobsługa. Analityk może samodzielnie znaleźć, zrozumieć i ocenić zbiór danych — bez zgłaszania zgłoszenia ani czekania, aż inżynier wyjaśni, co zawiera tabela.
Co robi Przeglądarka danych
Przeglądarka danych odpowiada na jedno kluczowe pytanie: „Jakie dane posiadamy i czy mogę im ufać?" Jest zbudowana wokół paska wyszukiwania oraz zestawu widoków świadomych ładu danych, które pozwalają przejść od słowa kluczowego do w pełni zrozumianej tabeli — jej kolumn, przykładowych wierszy, statystyk profilowania, pochodzenia danych oraz reguł jakości.
Baza tras: /data-browser. Plik wejściowy: src/pages/DataBrowser.tsx. Katalog jest wspierany przez kontroler CatalogController metadata-service oraz katalog zgodny z OpenMetadata.
Zasady projektowe
- Skoncentrowana na wyszukiwaniu — pasek wyszukiwania jest główną interakcją; wszystko inne jest nawigacją drugorzędną.
- Stopniowe ujawnianie — strona docelowa pokazuje domeny i popularne tabele; szczegóły pojawiają się po kliknięciu.
- Widoczność ładu danych — znaczniki PII, plakietki certyfikacji i oceny jakości nigdy nie są ukrywane.
Kto z niej korzysta
| Persona | Jak jej używa |
|---|---|
| Marek — Business Analyst | Odkrywa tabele według słowa kluczowego lub domeny bez pytania działu inżynierii |
| Tomasz — Data Steward | Weryfikuje oznaczanie PII i certyfikację, bada pochodzenie kolumn |
| Anna — Data Engineer | Podgląda przykładowe dane przed zbudowaniem potoku danych; przechodzi do Design Studio |
| Katarzyna — administrator platformy | Audytuje pokrycie majątku i własność |
Układ ekranu — strona docelowa Przeglądania / Wyszukiwania
Strona docelowa (/data-browser) otwiera się dużym paskiem wyszukiwania i rozmieszcza pod nim powierzchnie odkrywania.
+----------------------------------------------------------------------+
| DATA BROWSER |
| Discover, explore, and understand your data assets. |
| |
| +----------------------------------------------------------------+ |
| | [search] Search tables, columns, datasets... | |
| +----------------------------------------------------------------+ |
| |
| BROWSE BY DOMAIN |
| +--------+ +---------+ +---------+ +--------+ +-------------+ |
| | CRM | | Billing | | Network | | CDR | | Reference | |
| | 47 tbl | | 32 tbl | | 28 tbl | | 19 tbl | | Data 14 tbl | |
| +--------+ +---------+ +---------+ +--------+ +-------------+ |
| |
| +-----------------------------+ +-------------------------------+ |
| | RECENTLY VIEWED | | POPULAR TABLES | |
| | DIM_CUSTOMER 3 min ago | | FACT_REVENUE 96 | |
| | FACT_CDR_DAILY 1 hr ago | | DIM_SUBSCRIBER 91 | |
| | BIURO_SPRZEDAZY yesterday | | DIM_CUSTOMER 88 | |
| | STG_NETWORK_EV. 2 days ago | | FACT_CDR_DAILY 85 | |
| +-----------------------------+ +-------------------------------+ |
| |
| TAGS |
| [ PII 84 ] [ Confidential 31 ] [ Certified 67 ] [ Draft 23 ] |
| [ Deprecated 8 ] |
+----------------------------------------------------------------------+
Elementy sterujące interfejsu
| Element sterujący | Zachowanie |
|---|---|
| Pasek wyszukiwania | Podpowiedzi typu typeahead z opóźnieniem; Enter przechodzi do /data-browser/search?q= |
| Kafelki domen | Pięć kafelków (CRM, Billing, Network, CDR, Reference Data) z liczbami tabel; kliknięcie filtruje wyszukiwanie według domeny |
| Ostatnio przeglądane | Tabele, które ostatnio otwierałeś, ze względnymi znacznikami czasu |
| Popularne tabele | Najczęściej używane tabele, posortowane według oceny popularności 0–100 |
| Chmura znaczników | Pigułki filtrów dla PII, Confidential, Certified, Draft i Deprecated, każda z licznikiem |
Znaczniki ładu danych
Każda tabela i kolumna może nosić znaczniki katalogu, oznaczone kolorem, aby status ładu danych był widoczny na pierwszy rzut oka.
| Znacznik | Znaczenie |
|---|---|
| PII | Zawiera informacje umożliwiające identyfikację osoby (np. MSISDN, imiona i nazwiska) |
| Confidential | Wrażliwe dane biznesowe |
| Certified | Przejrzana i zatwierdzona jako wiarygodna |
| Draft | Jeszcze nieprzejrzana |
| Deprecated | Zaplanowana do wycofania — unikaj budowania na niej nowych potoków danych |
Wyniki wyszukiwania
Wyszukiwanie przechodzi do /data-browser/search?q={query}, układu dwupanelowego: pasek boczny filtrów po lewej oraz lista wyników po prawej.
+------------------+ +--------------------------------------------+
| FILTERS | | 12 results for "churn" Sort: [Relevance]|
| | | |
| Database | | +----------------------------------------+ |
| [x] Teradata | | | DIM_CUSTOMER [PII][Certified]| |
| [x] Snowflake | | | Snowflake.DWH.DIM_CUSTOMER | |
| [ ] SAP HANA | | | Customer dimension with churn scoring..| |
| [ ] Databricks | | | Popularity: 88 Owner: Anna Nowak | |
| [ ] MSSQL | | +----------------------------------------+ |
| | | |
| Tags | | +----------------------------------------+ |
| [ ] PII | | | FACT_CHURN_MONTHLY [Certified]| |
| [ ] Confidential | | | Snowflake.DWH.FACT_CHURN_MONTHLY | |
| [ ] Certified | | | Monthly churn analysis fact table... | |
| | | | Popularity: 76 Owner: Marek Lew... | |
| Domain / Owner | | +----------------------------------------+ |
| [ Clear Filters ]| | ... (more results, scrollable) |
+------------------+ +--------------------------------------------+
Pasek boczny filtrów grupuje fasety w sekcje Database, Tags, Domain oraz Owner. Nagłówek wyników pokazuje liczbę wyników oraz listę rozwijaną Sort z trzema opcjami: Relevance, Popularity i Recently Updated. Każdy kafelek wyniku pokazuje nazwę tabeli, w pełni kwalifikowaną nazwę, skrócony opis, pigułki znaczników, ocenę popularności oraz właściciela; dopasowany termin zapytania jest podświetlony.
Widok szczegółów tabeli
Kliknięcie wyniku otwiera widok szczegółów tabeli pod /data-browser/table/{database}/{schema}/{table}. Pasek nagłówka niesie w pełni kwalifikowaną nazwę, plakietkę certyfikacji, opis, właściciela, czas ostatniej aktualizacji, liczby wierszy i kolumn, znaczniki oraz domenę — plus przycisk Create pipeline from this table, który przekazuje sterowanie do Design Studio.
Poniżej nagłówka sześć kart organizuje metadane tabeli:
| Karta | Co pokazuje |
|---|---|
| Columns | Każda kolumna — nazwa, typ, opis, dopuszczalność wartości pustych, znaczniki, liczba odrębnych wartości, % wartości pustych |
| Sample Data | Przewijalny w poziomie podgląd przykładowych wierszy |
| Profiling | Karty profilowania dla poszczególnych kolumn z histogramami rozkładu |
| Lineage | Mini-graf pochodzenia danych zależności w górę i w dół strumienia |
| Quality | Siatka reguł jakości ze statusem zaliczony/niezaliczony i współczynnikami zaliczeń |
| Activity | Oś czasu aktywności katalogu — edycje opisów, zmiany znaczników |
Karta Columns
Karta Columns jest domyślna. Renderuje tabelę, w której każda nazwa kolumny jest klikalna. Kolumny PII są oznaczane wbudowanie, a statystyki dla poszczególnych kolumn — liczba odrębnych wartości, procent wartości pustych, min/max, średnia, procent unikalnych — pochodzą z danych profilowania katalogu.
+-----+-------------+----------+----------+-------+-------------+--------+
| # | Name | Type | Nullable | Tags | Distinct | Null % |
+-----+-------------+----------+----------+-------+-------------+--------+
| 1 | CUSTOMER_ID | BIGINT | No | | 8,420,316 | 0.0% |
| 2 | MSISDN | VARCHAR | No | [PII] | 8,418,200 | 0.0% |
| 3 | FIRST_NAME | VARCHAR | No | [PII] | 142,300 | 0.1% |
| 5 | CHURN_SCORE | DECIMAL | Yes | | 87 | 0.3% |
| 8 | ARPU | DECIMAL | Yes | | 4,230 | 0.2% |
+-----+-------------+----------+----------+-------+-------------+--------+
Panel wysuwany ze szczegółami kolumny
Kliknięcie nazwy kolumny otwiera panel Szczegółów kolumny jako panel wysuwany (adres URL zyskuje parametr ?column=). Pokazuje statystyki dla danej kolumny, histogram profilowania, znaczniki PII oraz pochodzenie danych na poziomie kolumny — pozwalając opiekunowi danych potwierdzić klasyfikację i pochodzenie kolumny bez opuszczania tabeli.
Produkty danych i rynek
Poza surowymi tabelami platforma udostępnia wyselekcjonowane produkty danych — opakowane, objęte ładem danych zbiory danych gotowe do konsumpcji — poprzez Rynek danych.
| Trasa | Strona | Cel |
|---|---|---|
/data-marketplace | DataMarketplacePage | Przeglądanie katalogu produktów danych |
/data-marketplace/products/:id | DataProductDetail | Strona szczegółów pojedynczego produktu danych |
Strona szczegółów produktu danych przedstawia opis produktu, zespół będący właścicielem, leżące u podstaw zbiory danych, status ładu danych oraz stan jakości — gotowy do konsumpcji odpowiednik widoków katalogu na poziomie tabeli.
Jak jej używać — ścieżki kliknięć
Znalezienie zbioru danych
- Otwórz
/data-browser. - Wpisz słowo kluczowe do paska wyszukiwania — na przykład „churn".
- Naciśnij
Enter, aby przejść do strony Wyników wyszukiwania. - Zawęź wyniki lewym paskiem bocznym filtrów — zaznacz Snowflake w sekcji Database lub Certified w sekcji Tags.
- Zmień kolejność listą rozwijaną Sort — przełącz na Popularity, aby na początku pokazać najczęściej używane tabele.
- Kliknij kafelek wyniku, aby otworzyć jego widok szczegółów tabeli.
Co dzieje się w tle: api/search.ts uruchamia uszeregowane wyszukiwanie w katalogu; api/catalog.ts rozwiązuje podsumowania tabel.
Podgląd tabeli
- W widoku szczegółów tabeli kliknij kartę Sample Data.
- Przewijalna w poziomie siatka pokazuje przykładowe wiersze, z wartościami
NULLrenderowanymi w sposób wyróżniony oraz stopką „Showing N of total". - Przełącz na kartę Profiling, aby zbadać rozkłady i statystyki dla poszczególnych kolumn.
- Otwórz kartę Quality, aby sprawdzić, które reguły jakości zaliczają lub nie zaliczają się na tabeli.
- Aby prześledzić pochodzenie, otwórz kartę Lineage lub kliknij nazwę kolumny, aby otworzyć panel wysuwany Szczegółów kolumny.
Co dzieje się w tle: api/catalog.ts dla kolumn i przykładowych danych, api/quality.ts dla reguł jakości, api/lineage.ts dla grafu pochodzenia danych, api/pii.ts dla znaczników PII.
Otwarcie produktu danych
- Przejdź do
/data-marketplace. - Przeglądaj lub przeszukuj katalog wyselekcjonowanych produktów danych.
- Kliknij produkt, aby otworzyć
/data-marketplace/products/{id}. - Przejrzyj jego opis, zespół będący właścicielem, leżące u podstaw zbiory danych, status ładu danych oraz stan jakości.
Co dzieje się w tle: api/dataProducts.ts wymienia i rozwiązuje produkty danych; api/endorsements.ts dostarcza status certyfikacji.
Od odkrywania do budowania
Przeglądarka danych jest zarówno wyrzutnią, jak i katalogiem. Z dowolnego widoku szczegółów tabeli przycisk Create pipeline from this table wstępnie wypełnia Design Studio tą tabelą jako źródłem — dzięki czemu analitycy i inżynierowie przechodzą od znalezienia danych do budowania na nich jednym kliknięciem.
Przewodnik — znajdź i oceń zbiór danych
Załóżmy, że poproszono Cię o analizę odejść klientów (churn), a nie wiesz, której tabeli użyć. Oto jak Przeglądarka danych przeprowadza Cię od niejasnego pytania do wiarygodnej tabeli w kilka minut.
- Otwórz Przeglądarkę danych. Kliknij Data Browser w lewym pasku bocznym.
- Wyszukaj według słowa kluczowego. Kliknij duży pasek wyszukiwania, wpisz
churni naciśnijEnter. Trafisz na stronę Wyników wyszukiwania. - Przeczytaj kafelki wyników. Każdy kafelek pokazuje nazwę tabeli, gdzie się znajduje, krótki opis, jej znaczniki, ocenę popularności oraz jej właściciela. Ocena popularności mówi Ci, które tabele faktycznie wykorzystują Twoi koledzy — mocna wskazówka, którym ufać.
- Zawęź. Użyj lewego paska bocznego filtrów — zaznacz Snowflake w sekcji Database, jeśli chcesz tylko tabel hurtowni, lub zaznacz Certified w sekcji Tags, aby zobaczyć tylko dane zatwierdzone przez opiekuna.
- Sortuj sprytnie. Zmień listę rozwijaną Sort na Popularity, aby najczęściej używane tabele wypłynęły na górę.
- Otwórz tabelę. Kliknij obiecujący wynik, na przykład
DIM_CUSTOMER. Otworzy się jego widok szczegółów tabeli. - Sprawdź, czy jest wiarygodna. Spójrz na nagłówek: plakietka Certified oznacza, że opiekun za nią ręczy. Otwórz kartę Quality, aby zobaczyć, które reguły jakości się zaliczają. Wysoka ocena jakości plus plakietka Certified oznaczają, że możesz na niej polegać.
- Zrozum kolumny. Karta Columns wymienia każde pole z jego typem i statystykami. Kolumny oznaczone PII zawierają dane osobowe — obsługuj je zgodnie z polityką.
- Zobacz rzeczywiste dane. Otwórz kartę Sample Data, aby uzyskać podgląd faktycznych wierszy, dzięki czemu wiesz, jak wyglądają wartości, zanim cokolwiek zbudujesz.
- Prześledź jej pochodzenie (opcjonalnie). Otwórz kartę Lineage lub kliknij nazwę kolumny, aby zobaczyć, skąd dane pochodzą i co od nich zależy.
- Zadziałaj na jej podstawie. Zadowolony? Kliknij Create pipeline from this table, aby przejść prosto do Design Studio z tą tabelą wstępnie wczytaną jako źródło.
Częste pytania
Jaka jest różnica między wyszukiwaniem w Przeglądarce danych a wyszukiwaniem globalnym Ctrl+K? Wyszukiwanie w Przeglądarce danych służy odkrywaniu — uszeregowane wyniki katalogu z filtrami, znacznikami PII, certyfikacją, pochodzeniem danych i jakością. Wyszukiwanie globalne Ctrl+K służy szybkiej nawigacji — przeskakiwaniu do znanego potoku danych, tabeli, użytkownika lub ustawienia z dowolnego miejsca. Użyj wyszukiwania globalnego, gdy wiesz, czego chcesz; użyj Przeglądarki danych, gdy wciąż się tego doszukujesz.
Co właściwie oznacza plakietka „Certified"? Opiekun danych formalnie przejrzał tabelę — jej jakość, jej pochodzenie danych, jej klasyfikację PII — i zatwierdził ją jako wiarygodną. Preferuj tabele Certified do ważnej pracy. Znacznik Draft oznacza coś przeciwnego: jeszcze nieprzejrzana. Deprecated oznacza, że jest wycofywana — nie buduj na niej nowych potoków danych.
Czym jest ocena popularności? Liczba 0–100 odzwierciedlająca, jak bardzo tabela jest używana na platformie. Wysoka ocena jest użytecznym sygnałem, że koledzy już na niej polegają, choć nie zastępuje plakietki Certified.
Widzę kolumnę oznaczoną PII — czy nadal mogę jej użyć? Tak, ale ostrożnie. PII (imiona i nazwiska, numery telefonów, PESEL) to dane osobowe chronione prawem. Stosuj się do polityki swojej organizacji: może wymagać zamaskowania, a dostęp może być ograniczony według roli. W razie wątpliwości zapytaj opiekuna danych.
Jaka jest różnica między tabelą a produktem danych? Tabela to surowe dane prosto z bazy danych. Produkt danych to wyselekcjonowany, opakowany, objęty ładem danych zbiór danych — złożony i udokumentowany do bezpośredniej konsumpcji — znajdujący się w Rynku danych. Produkty danych są dopracowaną, gotową do użycia opcją.
Statystyki mówią, że kolumna jest w 30% pusta — czy to problem? „Null" oznacza pusty — brak zarejestrowanej wartości. To, czy 30% pustych jest problemem, zależy całkowicie od kolumny. Brakujące opcjonalne drugie imię to nic złego; brakujący identyfikator klienta to poważna sprawa. Karta Profiling pokazuje Ci ten wskaźnik, abyś mógł go ocenić dla swojego przypadku użycia.
Czy mogę dodać opis lub znacznik do tabeli? Opiekunowie, administratorzy, inżynierowie i analitycy mogą edytować adnotacje katalogu (opisy, znaczniki, odnośniki słownikowe). Każda zmiana adnotacji jest zapisywana w ścieżce audytu i widoczna dla wszystkich w przestrzeni roboczej.
Nakładka wyszukiwania globalnego
Pasek wyszukiwania Przeglądarki danych to głębokie, świadome ładu danych wyszukiwanie w katalogu. Obok niego powłoka platformy zapewnia lżejszą nakładkę wyszukiwania globalnego — modal w stylu palety poleceń do przeskakiwania do czegokolwiek gdziekolwiek w DataFlow AI bez opuszczania bieżącej strony.

Jak to działa
Naciśnij Cmd+K (macOS) lub Ctrl+K (Windows/Linux) z dowolnego miejsca w aplikacji — albo kliknij wyzwalacz wyszukiwania w górnym pasku — aby otworzyć nakładkę. Jest to wyśrodkowany modal nad rozmytym tłem, skupiony na pojedynczym polu tekstowym.
| Zachowanie | Szczegół |
|---|---|
| Otwarcie / przełączenie | Cmd+K / Ctrl+K lub wyzwalacz wyszukiwania w górnym pasku |
| Zamknięcie | Escape lub kliknięcie tła |
| Nawigacja | Strzałka w górę / w dół, aby przesunąć zaznaczenie, Enter, aby przeskoczyć do podświetlonego wyniku |
| Stan pusty | Bez wpisanego zapytania nakładka pokazuje ostatnie wyszukiwania |
| Wyniki | Filtrowane na żywo w trakcie pisania, pogrupowane według kategorii |
Kategorie wyników
Wyniki są pogrupowane w pięć kategorii, każda z własną ikoną i kolorem:
| Kategoria | Kolor ikony | Przykładowy wynik |
|---|---|---|
| Pipelines | niebieski | wf_Subscriber_Churn_v2 — Staging, oczekuje na zatwierdzenie |
| Tables | szmaragdowy | DIM_SUBSCRIBER_360 — Snowflake / DWH / 12,4 mln wierszy |
| Columns | bursztynowy | CUSTOMER_CHURN_SCORE — DIM_SUBSCRIBER_360.CHURN_SCORE, float64 |
| Users | fioletowy | Anna Kowalska — Data Engineer, BI & Data Engineering |
| Settings | szary | Connection: Teradata DWH-MONA — JDBC, Active |
Wyszukiwanie globalne a Przeglądarka danych
Użyj nakładki wyszukiwania globalnego (Cmd+K) do szybkiej nawigacji — przeskakiwania do znanego potoku danych, tabeli, użytkownika lub ustawienia. Użyj paska wyszukiwania Przeglądarki danych do odkrywania i ładu danych — uszeregowanych wyników katalogu z filtrami fasetowymi, znacznikami PII, plakietkami certyfikacji, pochodzeniem danych i jakością. Wyszukiwanie globalne kieruje Cię do miejsca docelowego; Przeglądarka danych pomaga zrozumieć dane i im zaufać, gdy już dotrzesz.
Nakładka jest zaimplementowana przez src/components/shell/GlobalSearchModal.tsx, otwierana z GlobalSearchTrigger.tsx w górnym pasku, ze stanem otwarcia przechowywanym w shellStore.
Co dzieje się w tle — podsumowanie API
| Możliwość | Moduł API |
|---|---|
| Tabele i kolumny katalogu | api/catalog.ts |
| Uszeregowane wyszukiwanie | api/search.ts |
| Produkty danych / rynek | api/dataProducts.ts |
| Graf pochodzenia danych | api/lineage.ts |
| Reguły jakości | api/quality.ts |
| Znaczniki PII | api/pii.ts |
| Certyfikacja | api/endorsements.ts |
| Pytania i odpowiedzi katalogu w NL | api/catalogAsk.ts (prezentowane także przez Copilot AI) |
Komponenty interfejsu Przeglądarki danych mieszczą się w src/components/data-browser/ — w tym CatalogSearch, ConnectionTree, SchemaViewer, TableCard, ColumnDetail, DataProfile oraz SampleDataPreview. Powiązane wdrożone strony obejmują DataMarketplacePage.tsx oraz DataProductDetail.tsx.
Słownik
Definicje prostym językiem terminów używanych w całej dokumentacji DataFlow AI.
| Termin | Definicja |
|---|---|
| ETL | Extract, Transform, Load — kopiowanie danych ze systemów źródłowych, czyszczenie i przekształcanie ich oraz wczytywanie do docelowej hurtowni. |
| ELT | Extract, Load, Transform — wariant, w którym surowe dane są najpierw wczytywane do hurtowni i przekształcane w miejscu wewnątrz niej. |
| Potok danych | Zautomatyzowany przepis — graf węzłów przetwarzania — który odczytuje ze źródeł, przekształca dane i zapisuje je do miejsc docelowych. |
| Węzeł | Pojedyncze pole przetwarzania w potoku danych: źródło, transformacja, kontrola jakości lub cel. |
| DAG | Directed Acyclic Graph (skierowany graf acykliczny) — kształt schematu blokowego potoku danych; strzałki wskazują w jedną stronę i nigdy nie zawracają. |
| Konektor | Skonfigurowane, wielokrotnego użytku połączenie z zewnętrznym systemem danych, takim jak baza danych Oracle czy klaster Kafka. |
| Źródło / Ujście | Węzeł źródła odczytuje dane do potoku danych; węzeł ujścia (lub celu) zapisuje gotowe dane na zewnątrz. |
| Przestrzeń robocza | Odizolowane środowisko, które obejmuje własne potoki danych, konektory, reguły i członków — jak projekt lub przestrzeń zespołu. |
| Uruchomienie | Pojedyncze wykonanie potoku danych, z własnym identyfikatorem, statusem, znacznikami czasu i dziennikami. |
| Wsadowe vs. strumieniowe | Potoki danych wsadowe działają według harmonogramu i przetwarzają fragment danych naraz; potoki danych strumieniowe działają nieprzerwanie, przetwarzając każdy rekord w ciągu sekund. |
| CDC | Change Data Capture — przechwytywanie każdej zmiany wiersza bazy danych (wstawienie/aktualizacja/usunięcie) w czasie rzeczywistym z dziennika transakcji bazy danych, bez ponownego skanowania tabeli. |
| Push-down (przekazanie) | Optymalizacja, która tłumaczy transformację na natywny SQL i uruchamia ją wewnątrz bazy danych źródłowej lub docelowej, dzięki czemu duże wolumeny danych nigdy nie podróżują przez sieć. |
| Tryb zapisu | Sposób, w jaki cel dodaje dane: append (dodaj wiersze), overwrite (zastąp wszystko) lub upsert/merge (zaktualizuj istniejące wiersze, wstaw nowe). |
| Punkt kontrolny | Zapisany znacznik „jesteś-tutaj" w trakcie uruchomienia, pozwalający nieudanemu uruchomieniu wznowić się zamiast zaczynać od nowa. |
| SLA | Service Level Agreement (umowa o poziomie usług) — uzgodniona obietnica dotycząca tego, jak potok danych powinien działać (czas ukończenia, współczynnik powodzeń). |
| Pochodzenie danych | Udokumentowana droga danych od pochodzenia, przez każdą transformację, do ich miejsc docelowych; pochodzenie „na poziomie kolumny" śledzi pojedyncze pola. |
| Katalog | Przeszukiwalny katalog każdej tabeli i kolumny we wszystkich połączonych systemach. |
| Profilowanie | Automatycznie obliczane statystyki o kolumnie — wskaźnik wartości pustych, liczba odrębnych wartości, min/max, średnia i tak dalej. |
| Reguła jakości danych | Zautomatyzowana kontrola na zbiorze danych, taka jak „ta kolumna nigdy nie może być pusta" lub „ten kod musi mieć 15 cyfr". |
| Kwarantanna | Strefa przetrzymywania, w której wiersze, które nie przeszły blokującej reguły jakości danych, czekają na decyzję opiekuna, zamiast być wczytane lub utracone. |
| PII | Personally Identifiable Information (informacje umożliwiające identyfikację osoby) — dane, które mogą zidentyfikować rzeczywistą osobę (imię i nazwisko, telefon, PESEL); chronione przez RODO. |
| PESEL | Polski krajowy numer identyfikacyjny — wysoce wrażliwe dane PII obsługiwane pod ścisłą kontrolą RODO. |
| MSISDN | Numer telefonu abonenta komórkowego — wspólny klucz używany do łączenia danych abonentów telekomunikacyjnych. |
| GDPR / RODO | Unijne rozporządzenie o ochronie danych (2016/679); „RODO" to jego nazwa w prawie polskim. |
| DSAR | Data Subject Access Request — formalne żądanie osoby fizycznej dotyczące dostępu do jej danych osobowych, ich poprawienia lub usunięcia. |
| CDR | Call Detail Record (rekord szczegółów połączenia) — rekord wytwarzany przez sieć telekomunikacyjną opisujący połączenie, SMS lub sesję danych. |
| Produkt danych | Wyselekcjonowany, opakowany, objęty ładem danych zbiór danych przygotowany do bezpośredniej konsumpcji, opublikowany w Rynku danych. |
| Kontrakt danych | Wersjonowana, uzgodniona obietnica dotycząca schematu, typów i świeżości zbioru danych, między producentem danych a jego konsumentami. |
| Copilot AI | Konwersacyjny asystent AI platformy — odpowiada na pytania, pisze SQL, buduje potoki danych i diagnozuje awarie prostym językiem. |
| RAG | Retrieval-Augmented Generation — technika AI, która podaje modelowi istotne rzeczywiste dane katalogu, dzięki czemu jego odpowiedzi są oparte na faktach. |
| Migracja | Zautomatyzowana konwersja starszych przepływów ETL (Informatica PowerCenter, Alteryx) na potoki danych DataFlow AI. |
| Dialekt push-down | Konkretna „odmiana" SQL bazy danych docelowej (Teradata, Snowflake, Oracle itd.), dla której platforma generuje natywny SQL. |
| Opiekun (Steward) | Osoba odpowiedzialna za ład danych — jakość, pochodzenie danych, certyfikację, prywatność oraz przegląd potoków danych. |
| SSO | Single Sign-On (jednokrotne logowanie) — logowanie się raz przy użyciu firmowych poświadczeń w celu uzyskania dostępu do platformy, bez osobnego hasła. |