Przewodniki po funkcjach

Przeglądarka danych i katalog

Przeglądarka danych to warstwa odkrywania i ładu danych platformy DataFlow AI. Prezentuje katalog oparty na OpenMetadata, który pozwala przeszukiwać, eksplorować i rozumieć każdą tabelę, kolumnę i zbiór danych w heterogenicznym majątku danych Polkomtela — Teradata DWH-MONA, Snowflake, SAP HANA, Databricks oraz MSSQL/Sybase. Jest skoncentrowana na wyszukiwaniu i widoczna pod kątem ładu danych: znaczniki PII, plakietki certyfikacji i oceny jakości są zawsze wyświetlane.


Nowy tutaj? Czym jest „katalog danych"

Duża firma jak Polkomtel przechowuje dane w dziesiątkach różnych baz danych. Nikt nie jest w stanie zapamiętać, co jest we wszystkich z nich. Katalog danych rozwiązuje ten problem — jest przeszukiwalnym katalogiem każdej tabeli i kolumny, jaką firma posiada, niezależnie od tego, w której bazie danych się znajduje. Pomyśl o nim jak o katalogu bibliotecznym danych firmy: przeszukujesz go, aby znaleźć to, czego potrzebujesz, a następnie czytasz jego „kartę", aby zrozumieć, co znalazłeś.

Przeglądarka danych jest tym katalogiem. Dzięki niej możesz:

  • Wyszukiwać dane według słowa kluczowego — wpisz „churn" i zobacz każdą powiązaną tabelę we wszystkich systemach.
  • Przeglądać dane pogrupowane według obszaru biznesowego (Klienci, Rozliczenia, Sieć i tak dalej).
  • Rozumieć tabelę, zanim jej użyjesz — zobacz jej kolumny, próbkę rzeczywistych wierszy oraz statystyki.
  • Ufać jej — zobacz, czy została sprawdzona pod kątem jakości i certyfikowana oraz czy zawiera dane prywatne.
  • Śledzić skąd dany element danych pochodzi i dokąd przepływa.

Kilka słów, które zobaczysz na tych ekranach:

  • Tabela — siatka danych, jak zakładka arkusza kalkulacyjnego. Kolumny to jej pola (np. FIRST_NAME); wiersze to jej rekordy (jeden na klienta).
  • Schemat — nazwana grupa powiązanych tabel wewnątrz bazy danych.
  • PIIPersonally Identifiable Information (informacje umożliwiające identyfikację osoby): dane, które identyfikują rzeczywistą osobę (imię i nazwisko, numer telefonu). Są oznaczone specjalnym znacznikiem, ponieważ muszą być obsługiwane ostrożnie.
  • Certyfikowana — plakietka oznaczająca, że opiekun danych przejrzał tabelę i poręcza, że jest wiarygodna.
  • Pochodzenie danych — udokumentowana droga danych, pokazująca, skąd pochodzą wartości tabeli i co z niej wypływa.
  • Profilowanie — automatyczne statystyki o kolumnie: ile wierszy jest pustych, ile ma odrębnych wartości, jaka jest najmniejsza i największa wartość i tak dalej.

Bez konieczności zgłaszania do działu inżynierii

Cały sens Przeglądarki danych to samoobsługa. Analityk może samodzielnie znaleźć, zrozumieć i ocenić zbiór danych — bez zgłaszania zgłoszenia ani czekania, aż inżynier wyjaśni, co zawiera tabela.


Co robi Przeglądarka danych

Przeglądarka danych odpowiada na jedno kluczowe pytanie: „Jakie dane posiadamy i czy mogę im ufać?" Jest zbudowana wokół paska wyszukiwania oraz zestawu widoków świadomych ładu danych, które pozwalają przejść od słowa kluczowego do w pełni zrozumianej tabeli — jej kolumn, przykładowych wierszy, statystyk profilowania, pochodzenia danych oraz reguł jakości.

Baza tras: /data-browser. Plik wejściowy: src/pages/DataBrowser.tsx. Katalog jest wspierany przez kontroler CatalogController metadata-service oraz katalog zgodny z OpenMetadata.

Zasady projektowe

  • Skoncentrowana na wyszukiwaniu — pasek wyszukiwania jest główną interakcją; wszystko inne jest nawigacją drugorzędną.
  • Stopniowe ujawnianie — strona docelowa pokazuje domeny i popularne tabele; szczegóły pojawiają się po kliknięciu.
  • Widoczność ładu danych — znaczniki PII, plakietki certyfikacji i oceny jakości nigdy nie są ukrywane.

Kto z niej korzysta

PersonaJak jej używa
Marek — Business AnalystOdkrywa tabele według słowa kluczowego lub domeny bez pytania działu inżynierii
Tomasz — Data StewardWeryfikuje oznaczanie PII i certyfikację, bada pochodzenie kolumn
Anna — Data EngineerPodgląda przykładowe dane przed zbudowaniem potoku danych; przechodzi do Design Studio
Katarzyna — administrator platformyAudytuje pokrycie majątku i własność

Układ ekranu — strona docelowa Przeglądania / Wyszukiwania

Strona docelowa (/data-browser) otwiera się dużym paskiem wyszukiwania i rozmieszcza pod nim powierzchnie odkrywania.

+----------------------------------------------------------------------+
|  DATA BROWSER                                                        |
|  Discover, explore, and understand your data assets.                 |
|                                                                      |
|  +----------------------------------------------------------------+  |
|  | [search]  Search tables, columns, datasets...                  |  |
|  +----------------------------------------------------------------+  |
|                                                                      |
|  BROWSE BY DOMAIN                                                    |
|  +--------+ +---------+ +---------+ +--------+ +-------------+        |
|  |  CRM   | | Billing | | Network | |  CDR   | | Reference   |        |
|  | 47 tbl | | 32 tbl  | | 28 tbl  | | 19 tbl | | Data 14 tbl |        |
|  +--------+ +---------+ +---------+ +--------+ +-------------+        |
|                                                                      |
|  +-----------------------------+  +-------------------------------+  |
|  | RECENTLY VIEWED             |  | POPULAR TABLES                |  |
|  | DIM_CUSTOMER     3 min ago  |  | FACT_REVENUE             96   |  |
|  | FACT_CDR_DAILY   1 hr ago   |  | DIM_SUBSCRIBER           91   |  |
|  | BIURO_SPRZEDAZY  yesterday  |  | DIM_CUSTOMER             88   |  |
|  | STG_NETWORK_EV.  2 days ago |  | FACT_CDR_DAILY           85   |  |
|  +-----------------------------+  +-------------------------------+  |
|                                                                      |
|  TAGS                                                                |
|  [ PII 84 ]  [ Confidential 31 ]  [ Certified 67 ]  [ Draft 23 ]     |
|  [ Deprecated 8 ]                                                    |
+----------------------------------------------------------------------+

Elementy sterujące interfejsu

Element sterującyZachowanie
Pasek wyszukiwaniaPodpowiedzi typu typeahead z opóźnieniem; Enter przechodzi do /data-browser/search?q=
Kafelki domenPięć kafelków (CRM, Billing, Network, CDR, Reference Data) z liczbami tabel; kliknięcie filtruje wyszukiwanie według domeny
Ostatnio przeglądaneTabele, które ostatnio otwierałeś, ze względnymi znacznikami czasu
Popularne tabeleNajczęściej używane tabele, posortowane według oceny popularności 0–100
Chmura znacznikówPigułki filtrów dla PII, Confidential, Certified, Draft i Deprecated, każda z licznikiem

Znaczniki ładu danych

Każda tabela i kolumna może nosić znaczniki katalogu, oznaczone kolorem, aby status ładu danych był widoczny na pierwszy rzut oka.

ZnacznikZnaczenie
PIIZawiera informacje umożliwiające identyfikację osoby (np. MSISDN, imiona i nazwiska)
ConfidentialWrażliwe dane biznesowe
CertifiedPrzejrzana i zatwierdzona jako wiarygodna
DraftJeszcze nieprzejrzana
DeprecatedZaplanowana do wycofania — unikaj budowania na niej nowych potoków danych

Wyniki wyszukiwania

Wyszukiwanie przechodzi do /data-browser/search?q={query}, układu dwupanelowego: pasek boczny filtrów po lewej oraz lista wyników po prawej.

+------------------+  +--------------------------------------------+
| FILTERS          |  | 12 results for "churn"    Sort: [Relevance]|
|                  |  |                                            |
| Database         |  | +----------------------------------------+ |
| [x] Teradata     |  | | DIM_CUSTOMER            [PII][Certified]| |
| [x] Snowflake    |  | | Snowflake.DWH.DIM_CUSTOMER             | |
| [ ] SAP HANA     |  | | Customer dimension with churn scoring..| |
| [ ] Databricks   |  | | Popularity: 88   Owner: Anna Nowak     | |
| [ ] MSSQL        |  | +----------------------------------------+ |
|                  |  |                                            |
| Tags             |  | +----------------------------------------+ |
| [ ] PII          |  | | FACT_CHURN_MONTHLY          [Certified]| |
| [ ] Confidential |  | | Snowflake.DWH.FACT_CHURN_MONTHLY       | |
| [ ] Certified    |  | | Monthly churn analysis fact table...   | |
|                  |  | | Popularity: 76   Owner: Marek Lew...   | |
| Domain / Owner   |  | +----------------------------------------+ |
| [ Clear Filters ]|  |  ... (more results, scrollable)            |
+------------------+  +--------------------------------------------+

Pasek boczny filtrów grupuje fasety w sekcje Database, Tags, Domain oraz Owner. Nagłówek wyników pokazuje liczbę wyników oraz listę rozwijaną Sort z trzema opcjami: Relevance, Popularity i Recently Updated. Każdy kafelek wyniku pokazuje nazwę tabeli, w pełni kwalifikowaną nazwę, skrócony opis, pigułki znaczników, ocenę popularności oraz właściciela; dopasowany termin zapytania jest podświetlony.


Widok szczegółów tabeli

Kliknięcie wyniku otwiera widok szczegółów tabeli pod /data-browser/table/{database}/{schema}/{table}. Pasek nagłówka niesie w pełni kwalifikowaną nazwę, plakietkę certyfikacji, opis, właściciela, czas ostatniej aktualizacji, liczby wierszy i kolumn, znaczniki oraz domenę — plus przycisk Create pipeline from this table, który przekazuje sterowanie do Design Studio.

Poniżej nagłówka sześć kart organizuje metadane tabeli:

KartaCo pokazuje
ColumnsKażda kolumna — nazwa, typ, opis, dopuszczalność wartości pustych, znaczniki, liczba odrębnych wartości, % wartości pustych
Sample DataPrzewijalny w poziomie podgląd przykładowych wierszy
ProfilingKarty profilowania dla poszczególnych kolumn z histogramami rozkładu
LineageMini-graf pochodzenia danych zależności w górę i w dół strumienia
QualitySiatka reguł jakości ze statusem zaliczony/niezaliczony i współczynnikami zaliczeń
ActivityOś czasu aktywności katalogu — edycje opisów, zmiany znaczników

Karta Columns

Karta Columns jest domyślna. Renderuje tabelę, w której każda nazwa kolumny jest klikalna. Kolumny PII są oznaczane wbudowanie, a statystyki dla poszczególnych kolumn — liczba odrębnych wartości, procent wartości pustych, min/max, średnia, procent unikalnych — pochodzą z danych profilowania katalogu.

+-----+-------------+----------+----------+-------+-------------+--------+
| #   | Name        | Type     | Nullable | Tags  | Distinct    | Null % |
+-----+-------------+----------+----------+-------+-------------+--------+
| 1   | CUSTOMER_ID | BIGINT   | No       |       | 8,420,316   | 0.0%   |
| 2   | MSISDN      | VARCHAR  | No       | [PII] | 8,418,200   | 0.0%   |
| 3   | FIRST_NAME  | VARCHAR  | No       | [PII] | 142,300     | 0.1%   |
| 5   | CHURN_SCORE | DECIMAL  | Yes      |       | 87          | 0.3%   |
| 8   | ARPU        | DECIMAL  | Yes      |       | 4,230       | 0.2%   |
+-----+-------------+----------+----------+-------+-------------+--------+

Panel wysuwany ze szczegółami kolumny

Kliknięcie nazwy kolumny otwiera panel Szczegółów kolumny jako panel wysuwany (adres URL zyskuje parametr ?column=). Pokazuje statystyki dla danej kolumny, histogram profilowania, znaczniki PII oraz pochodzenie danych na poziomie kolumny — pozwalając opiekunowi danych potwierdzić klasyfikację i pochodzenie kolumny bez opuszczania tabeli.


Produkty danych i rynek

Poza surowymi tabelami platforma udostępnia wyselekcjonowane produkty danych — opakowane, objęte ładem danych zbiory danych gotowe do konsumpcji — poprzez Rynek danych.

TrasaStronaCel
/data-marketplaceDataMarketplacePagePrzeglądanie katalogu produktów danych
/data-marketplace/products/:idDataProductDetailStrona szczegółów pojedynczego produktu danych

Strona szczegółów produktu danych przedstawia opis produktu, zespół będący właścicielem, leżące u podstaw zbiory danych, status ładu danych oraz stan jakości — gotowy do konsumpcji odpowiednik widoków katalogu na poziomie tabeli.


Jak jej używać — ścieżki kliknięć

Znalezienie zbioru danych

  1. Otwórz /data-browser.
  2. Wpisz słowo kluczowe do paska wyszukiwania — na przykład „churn".
  3. Naciśnij Enter, aby przejść do strony Wyników wyszukiwania.
  4. Zawęź wyniki lewym paskiem bocznym filtrów — zaznacz Snowflake w sekcji Database lub Certified w sekcji Tags.
  5. Zmień kolejność listą rozwijaną Sort — przełącz na Popularity, aby na początku pokazać najczęściej używane tabele.
  6. Kliknij kafelek wyniku, aby otworzyć jego widok szczegółów tabeli.

Co dzieje się w tle: api/search.ts uruchamia uszeregowane wyszukiwanie w katalogu; api/catalog.ts rozwiązuje podsumowania tabel.

Podgląd tabeli

  1. W widoku szczegółów tabeli kliknij kartę Sample Data.
  2. Przewijalna w poziomie siatka pokazuje przykładowe wiersze, z wartościami NULL renderowanymi w sposób wyróżniony oraz stopką „Showing N of total".
  3. Przełącz na kartę Profiling, aby zbadać rozkłady i statystyki dla poszczególnych kolumn.
  4. Otwórz kartę Quality, aby sprawdzić, które reguły jakości zaliczają lub nie zaliczają się na tabeli.
  5. Aby prześledzić pochodzenie, otwórz kartę Lineage lub kliknij nazwę kolumny, aby otworzyć panel wysuwany Szczegółów kolumny.

Co dzieje się w tle: api/catalog.ts dla kolumn i przykładowych danych, api/quality.ts dla reguł jakości, api/lineage.ts dla grafu pochodzenia danych, api/pii.ts dla znaczników PII.

Otwarcie produktu danych

  1. Przejdź do /data-marketplace.
  2. Przeglądaj lub przeszukuj katalog wyselekcjonowanych produktów danych.
  3. Kliknij produkt, aby otworzyć /data-marketplace/products/{id}.
  4. Przejrzyj jego opis, zespół będący właścicielem, leżące u podstaw zbiory danych, status ładu danych oraz stan jakości.

Co dzieje się w tle: api/dataProducts.ts wymienia i rozwiązuje produkty danych; api/endorsements.ts dostarcza status certyfikacji.

Od odkrywania do budowania

Przeglądarka danych jest zarówno wyrzutnią, jak i katalogiem. Z dowolnego widoku szczegółów tabeli przycisk Create pipeline from this table wstępnie wypełnia Design Studio tą tabelą jako źródłem — dzięki czemu analitycy i inżynierowie przechodzą od znalezienia danych do budowania na nich jednym kliknięciem.


Przewodnik — znajdź i oceń zbiór danych

Załóżmy, że poproszono Cię o analizę odejść klientów (churn), a nie wiesz, której tabeli użyć. Oto jak Przeglądarka danych przeprowadza Cię od niejasnego pytania do wiarygodnej tabeli w kilka minut.

  1. Otwórz Przeglądarkę danych. Kliknij Data Browser w lewym pasku bocznym.
  2. Wyszukaj według słowa kluczowego. Kliknij duży pasek wyszukiwania, wpisz churn i naciśnij Enter. Trafisz na stronę Wyników wyszukiwania.
  3. Przeczytaj kafelki wyników. Każdy kafelek pokazuje nazwę tabeli, gdzie się znajduje, krótki opis, jej znaczniki, ocenę popularności oraz jej właściciela. Ocena popularności mówi Ci, które tabele faktycznie wykorzystują Twoi koledzy — mocna wskazówka, którym ufać.
  4. Zawęź. Użyj lewego paska bocznego filtrów — zaznacz Snowflake w sekcji Database, jeśli chcesz tylko tabel hurtowni, lub zaznacz Certified w sekcji Tags, aby zobaczyć tylko dane zatwierdzone przez opiekuna.
  5. Sortuj sprytnie. Zmień listę rozwijaną Sort na Popularity, aby najczęściej używane tabele wypłynęły na górę.
  6. Otwórz tabelę. Kliknij obiecujący wynik, na przykład DIM_CUSTOMER. Otworzy się jego widok szczegółów tabeli.
  7. Sprawdź, czy jest wiarygodna. Spójrz na nagłówek: plakietka Certified oznacza, że opiekun za nią ręczy. Otwórz kartę Quality, aby zobaczyć, które reguły jakości się zaliczają. Wysoka ocena jakości plus plakietka Certified oznaczają, że możesz na niej polegać.
  8. Zrozum kolumny. Karta Columns wymienia każde pole z jego typem i statystykami. Kolumny oznaczone PII zawierają dane osobowe — obsługuj je zgodnie z polityką.
  9. Zobacz rzeczywiste dane. Otwórz kartę Sample Data, aby uzyskać podgląd faktycznych wierszy, dzięki czemu wiesz, jak wyglądają wartości, zanim cokolwiek zbudujesz.
  10. Prześledź jej pochodzenie (opcjonalnie). Otwórz kartę Lineage lub kliknij nazwę kolumny, aby zobaczyć, skąd dane pochodzą i co od nich zależy.
  11. Zadziałaj na jej podstawie. Zadowolony? Kliknij Create pipeline from this table, aby przejść prosto do Design Studio z tą tabelą wstępnie wczytaną jako źródło.

Częste pytania

Jaka jest różnica między wyszukiwaniem w Przeglądarce danych a wyszukiwaniem globalnym Ctrl+K? Wyszukiwanie w Przeglądarce danych służy odkrywaniu — uszeregowane wyniki katalogu z filtrami, znacznikami PII, certyfikacją, pochodzeniem danych i jakością. Wyszukiwanie globalne Ctrl+K służy szybkiej nawigacji — przeskakiwaniu do znanego potoku danych, tabeli, użytkownika lub ustawienia z dowolnego miejsca. Użyj wyszukiwania globalnego, gdy wiesz, czego chcesz; użyj Przeglądarki danych, gdy wciąż się tego doszukujesz.

Co właściwie oznacza plakietka „Certified"? Opiekun danych formalnie przejrzał tabelę — jej jakość, jej pochodzenie danych, jej klasyfikację PII — i zatwierdził ją jako wiarygodną. Preferuj tabele Certified do ważnej pracy. Znacznik Draft oznacza coś przeciwnego: jeszcze nieprzejrzana. Deprecated oznacza, że jest wycofywana — nie buduj na niej nowych potoków danych.

Czym jest ocena popularności? Liczba 0–100 odzwierciedlająca, jak bardzo tabela jest używana na platformie. Wysoka ocena jest użytecznym sygnałem, że koledzy już na niej polegają, choć nie zastępuje plakietki Certified.

Widzę kolumnę oznaczoną PII — czy nadal mogę jej użyć? Tak, ale ostrożnie. PII (imiona i nazwiska, numery telefonów, PESEL) to dane osobowe chronione prawem. Stosuj się do polityki swojej organizacji: może wymagać zamaskowania, a dostęp może być ograniczony według roli. W razie wątpliwości zapytaj opiekuna danych.

Jaka jest różnica między tabelą a produktem danych? Tabela to surowe dane prosto z bazy danych. Produkt danych to wyselekcjonowany, opakowany, objęty ładem danych zbiór danych — złożony i udokumentowany do bezpośredniej konsumpcji — znajdujący się w Rynku danych. Produkty danych są dopracowaną, gotową do użycia opcją.

Statystyki mówią, że kolumna jest w 30% pusta — czy to problem? „Null" oznacza pusty — brak zarejestrowanej wartości. To, czy 30% pustych jest problemem, zależy całkowicie od kolumny. Brakujące opcjonalne drugie imię to nic złego; brakujący identyfikator klienta to poważna sprawa. Karta Profiling pokazuje Ci ten wskaźnik, abyś mógł go ocenić dla swojego przypadku użycia.

Czy mogę dodać opis lub znacznik do tabeli? Opiekunowie, administratorzy, inżynierowie i analitycy mogą edytować adnotacje katalogu (opisy, znaczniki, odnośniki słownikowe). Każda zmiana adnotacji jest zapisywana w ścieżce audytu i widoczna dla wszystkich w przestrzeni roboczej.


Nakładka wyszukiwania globalnego

Pasek wyszukiwania Przeglądarki danych to głębokie, świadome ładu danych wyszukiwanie w katalogu. Obok niego powłoka platformy zapewnia lżejszą nakładkę wyszukiwania globalnego — modal w stylu palety poleceń do przeskakiwania do czegokolwiek gdziekolwiek w DataFlow AI bez opuszczania bieżącej strony.

Modal nakładki wyszukiwania globalnego przedstawiający wyniki pogrupowane w kategorie potoków danych, tabel, kolumn, użytkowników i ustawień
Nakładka wyszukiwania globalnego (Cmd/Ctrl+K) to paleta poleceń do przeskakiwania do potoków danych, tabel, kolumn, użytkowników i ustawień w całej platformie.

Jak to działa

Naciśnij Cmd+K (macOS) lub Ctrl+K (Windows/Linux) z dowolnego miejsca w aplikacji — albo kliknij wyzwalacz wyszukiwania w górnym pasku — aby otworzyć nakładkę. Jest to wyśrodkowany modal nad rozmytym tłem, skupiony na pojedynczym polu tekstowym.

ZachowanieSzczegół
Otwarcie / przełączenieCmd+K / Ctrl+K lub wyzwalacz wyszukiwania w górnym pasku
ZamknięcieEscape lub kliknięcie tła
NawigacjaStrzałka w górę / w dół, aby przesunąć zaznaczenie, Enter, aby przeskoczyć do podświetlonego wyniku
Stan pustyBez wpisanego zapytania nakładka pokazuje ostatnie wyszukiwania
WynikiFiltrowane na żywo w trakcie pisania, pogrupowane według kategorii

Kategorie wyników

Wyniki są pogrupowane w pięć kategorii, każda z własną ikoną i kolorem:

KategoriaKolor ikonyPrzykładowy wynik
Pipelinesniebieskiwf_Subscriber_Churn_v2 — Staging, oczekuje na zatwierdzenie
TablesszmaragdowyDIM_SUBSCRIBER_360 — Snowflake / DWH / 12,4 mln wierszy
ColumnsbursztynowyCUSTOMER_CHURN_SCOREDIM_SUBSCRIBER_360.CHURN_SCORE, float64
UsersfioletowyAnna Kowalska — Data Engineer, BI & Data Engineering
SettingsszaryConnection: Teradata DWH-MONA — JDBC, Active

Wyszukiwanie globalne a Przeglądarka danych

Użyj nakładki wyszukiwania globalnego (Cmd+K) do szybkiej nawigacji — przeskakiwania do znanego potoku danych, tabeli, użytkownika lub ustawienia. Użyj paska wyszukiwania Przeglądarki danych do odkrywania i ładu danych — uszeregowanych wyników katalogu z filtrami fasetowymi, znacznikami PII, plakietkami certyfikacji, pochodzeniem danych i jakością. Wyszukiwanie globalne kieruje Cię do miejsca docelowego; Przeglądarka danych pomaga zrozumieć dane i im zaufać, gdy już dotrzesz.

Nakładka jest zaimplementowana przez src/components/shell/GlobalSearchModal.tsx, otwierana z GlobalSearchTrigger.tsx w górnym pasku, ze stanem otwarcia przechowywanym w shellStore.


Co dzieje się w tle — podsumowanie API

MożliwośćModuł API
Tabele i kolumny kataloguapi/catalog.ts
Uszeregowane wyszukiwanieapi/search.ts
Produkty danych / rynekapi/dataProducts.ts
Graf pochodzenia danychapi/lineage.ts
Reguły jakościapi/quality.ts
Znaczniki PIIapi/pii.ts
Certyfikacjaapi/endorsements.ts
Pytania i odpowiedzi katalogu w NLapi/catalogAsk.ts (prezentowane także przez Copilot AI)

Komponenty interfejsu Przeglądarki danych mieszczą się w src/components/data-browser/ — w tym CatalogSearch, ConnectionTree, SchemaViewer, TableCard, ColumnDetail, DataProfile oraz SampleDataPreview. Powiązane wdrożone strony obejmują DataMarketplacePage.tsx oraz DataProductDetail.tsx.


Słownik

Definicje prostym językiem terminów używanych w całej dokumentacji DataFlow AI.

TerminDefinicja
ETLExtract, Transform, Load — kopiowanie danych ze systemów źródłowych, czyszczenie i przekształcanie ich oraz wczytywanie do docelowej hurtowni.
ELTExtract, Load, Transform — wariant, w którym surowe dane są najpierw wczytywane do hurtowni i przekształcane w miejscu wewnątrz niej.
Potok danychZautomatyzowany przepis — graf węzłów przetwarzania — który odczytuje ze źródeł, przekształca dane i zapisuje je do miejsc docelowych.
WęzełPojedyncze pole przetwarzania w potoku danych: źródło, transformacja, kontrola jakości lub cel.
DAGDirected Acyclic Graph (skierowany graf acykliczny) — kształt schematu blokowego potoku danych; strzałki wskazują w jedną stronę i nigdy nie zawracają.
KonektorSkonfigurowane, wielokrotnego użytku połączenie z zewnętrznym systemem danych, takim jak baza danych Oracle czy klaster Kafka.
Źródło / UjścieWęzeł źródła odczytuje dane do potoku danych; węzeł ujścia (lub celu) zapisuje gotowe dane na zewnątrz.
Przestrzeń roboczaOdizolowane środowisko, które obejmuje własne potoki danych, konektory, reguły i członków — jak projekt lub przestrzeń zespołu.
UruchomieniePojedyncze wykonanie potoku danych, z własnym identyfikatorem, statusem, znacznikami czasu i dziennikami.
Wsadowe vs. strumieniowePotoki danych wsadowe działają według harmonogramu i przetwarzają fragment danych naraz; potoki danych strumieniowe działają nieprzerwanie, przetwarzając każdy rekord w ciągu sekund.
CDCChange Data Capture — przechwytywanie każdej zmiany wiersza bazy danych (wstawienie/aktualizacja/usunięcie) w czasie rzeczywistym z dziennika transakcji bazy danych, bez ponownego skanowania tabeli.
Push-down (przekazanie)Optymalizacja, która tłumaczy transformację na natywny SQL i uruchamia ją wewnątrz bazy danych źródłowej lub docelowej, dzięki czemu duże wolumeny danych nigdy nie podróżują przez sieć.
Tryb zapisuSposób, w jaki cel dodaje dane: append (dodaj wiersze), overwrite (zastąp wszystko) lub upsert/merge (zaktualizuj istniejące wiersze, wstaw nowe).
Punkt kontrolnyZapisany znacznik „jesteś-tutaj" w trakcie uruchomienia, pozwalający nieudanemu uruchomieniu wznowić się zamiast zaczynać od nowa.
SLAService Level Agreement (umowa o poziomie usług) — uzgodniona obietnica dotycząca tego, jak potok danych powinien działać (czas ukończenia, współczynnik powodzeń).
Pochodzenie danychUdokumentowana droga danych od pochodzenia, przez każdą transformację, do ich miejsc docelowych; pochodzenie „na poziomie kolumny" śledzi pojedyncze pola.
KatalogPrzeszukiwalny katalog każdej tabeli i kolumny we wszystkich połączonych systemach.
ProfilowanieAutomatycznie obliczane statystyki o kolumnie — wskaźnik wartości pustych, liczba odrębnych wartości, min/max, średnia i tak dalej.
Reguła jakości danychZautomatyzowana kontrola na zbiorze danych, taka jak „ta kolumna nigdy nie może być pusta" lub „ten kod musi mieć 15 cyfr".
KwarantannaStrefa przetrzymywania, w której wiersze, które nie przeszły blokującej reguły jakości danych, czekają na decyzję opiekuna, zamiast być wczytane lub utracone.
PIIPersonally Identifiable Information (informacje umożliwiające identyfikację osoby) — dane, które mogą zidentyfikować rzeczywistą osobę (imię i nazwisko, telefon, PESEL); chronione przez RODO.
PESELPolski krajowy numer identyfikacyjny — wysoce wrażliwe dane PII obsługiwane pod ścisłą kontrolą RODO.
MSISDNNumer telefonu abonenta komórkowego — wspólny klucz używany do łączenia danych abonentów telekomunikacyjnych.
GDPR / RODOUnijne rozporządzenie o ochronie danych (2016/679); „RODO" to jego nazwa w prawie polskim.
DSARData Subject Access Request — formalne żądanie osoby fizycznej dotyczące dostępu do jej danych osobowych, ich poprawienia lub usunięcia.
CDRCall Detail Record (rekord szczegółów połączenia) — rekord wytwarzany przez sieć telekomunikacyjną opisujący połączenie, SMS lub sesję danych.
Produkt danychWyselekcjonowany, opakowany, objęty ładem danych zbiór danych przygotowany do bezpośredniej konsumpcji, opublikowany w Rynku danych.
Kontrakt danychWersjonowana, uzgodniona obietnica dotycząca schematu, typów i świeżości zbioru danych, między producentem danych a jego konsumentami.
Copilot AIKonwersacyjny asystent AI platformy — odpowiada na pytania, pisze SQL, buduje potoki danych i diagnozuje awarie prostym językiem.
RAGRetrieval-Augmented Generation — technika AI, która podaje modelowi istotne rzeczywiste dane katalogu, dzięki czemu jego odpowiedzi są oparte na faktach.
MigracjaZautomatyzowana konwersja starszych przepływów ETL (Informatica PowerCenter, Alteryx) na potoki danych DataFlow AI.
Dialekt push-downKonkretna „odmiana" SQL bazy danych docelowej (Teradata, Snowflake, Oracle itd.), dla której platforma generuje natywny SQL.
Opiekun (Steward)Osoba odpowiedzialna za ład danych — jakość, pochodzenie danych, certyfikację, prywatność oraz przegląd potoków danych.
SSOSingle Sign-On (jednokrotne logowanie) — logowanie się raz przy użyciu firmowych poświadczeń w celu uzyskania dostępu do platformy, bez osobnego hasła.
Poprzednia
Asystent AI Copilot