Operacje
Scenariusze wdrożenia i wymiarowanie
DataFlow AI można wdrożyć w trzech różnych topologiach, z których każda oferuje inny balans między kosztem, kontrolą a czasem uruchomienia. Ta strona opisuje wszystkie trzy — lokalną (on-premises), pełną chmurę GCP oraz zalecaną hybrydową — wraz z ich wymaganiami infrastrukturalnymi, wymiarowaniem pojemności, tabelami kosztów, postawą bezpieczeństwa oraz przewodnikiem decyzyjnym ułatwiającym wybór między nimi.
Trzy topologie w skrócie
„Topologia” oznacza tutaj to, gdzie działa platforma i gdzie znajdują się dane. Dokument źródłowy scenariuszy wdrożenia definiuje trzy i zaleca topologię hybrydową dla Polkomtel Plus.
| Topologia | Gdzie działa | 3-letni TCO (USD) | Koszt roczny | Czas do pierwszego potoku produkcyjnego | Pełna produkcja |
|---|---|---|---|---|---|
| 1. Lokalna (on-premises) | Własne centrum danych Polkomtela w Warszawie | 1 836 000 USD (≈2 286 000 PLN z CapEx) | 582 tys. USD OpEx + 540 tys. USD CapEx w roku 0 | 14–24 tygodni | 6–9 miesięcy |
| 2. Pełna chmura GCP | GCP europe-central2 (Warszawa), DR w europe-west3 (Frankfurt) | 495 000 USD (realistyczny) | 165 000 USD (realistyczny) | 3–4 tygodnie | 2–3 miesiące |
| 3. Hybrydowa ⭐ Zalecana | Bazy danych źródłowe pozostają on-premises; platforma działa na GCP | 606 000–741 000 USD | 197 000–242 000 USD | 10–14 tygodni | 4–6 miesięcy |
Kilka terminów używanych w całej tej stronie:
- CapEx (capital expenditure) — duży zakup początkowy, np. zakup serwerów.
- OpEx (operating expenditure) — koszt powtarzalny, np. miesięczny rachunek za chmurę.
- TCO (total cost of ownership) — całkowity koszt w określonym okresie, tutaj trzy lata.
- CDC (change data capture) — strumieniowanie każdej zmiany w bazie danych w momencie jej wystąpienia.
- DR (disaster recovery) — awaryjna kopia systemu w drugiej lokalizacji.
Podstawa wyceny
Wszystkie wartości kosztów wykorzystują ceny katalogowe GCP na I kw. 2026, kurs wymiany 1 USD = 4,00 PLN oraz ceny kanału enterprise Dell dla Polski na I kw. 2026. Polski VAT (23%) nie jest uwzględniony w żadnej tabeli kosztów. GCP zawsze rozlicza się w USD, co wprowadza ryzyko kursowe dla budżetu denominowanego w PLN.
Scenariusz 1 — Lokalny (on-premises)
Każdy komponent DataFlow AI działa na sprzęcie, który Polkomtel posiada i obsługuje we własnym centrum danych w Warszawie, na serwerach bare-metal Dell PowerEdge lub wirtualizowanych VMware, z Kubernetes dostarczanym przez Red Hat OpenShift. Żadne dane nigdy nie opuszczają sieci korporacyjnej — jest to opcja maksymalnej suwerenności danych.
Najważniejsze liczby: 2 160 000 PLN CapEx · 582 tys. USD rocznego OpEx · 1,836 mln USD 3-letniego TCO · do 24 tygodni do uruchomienia · 13 węzłów Kubernetes (10 roboczych + 3 płaszczyzny sterowania) · 100% suwerenności danych.
Infrastruktura — sprzęt do zakupu (CapEx)
Topologia lokalna wymaga jednorazowego zakupu sprzętu o łącznej wartości 2 160 000 PLN (≈540 000 USD).
| Komponent | Specyfikacja | Liczba | Jednostkowo (PLN) | Łącznie (PLN) |
|---|---|---|---|---|
| Węzły robocze Kubernetes | Dell PowerEdge R750 · 2× Xeon Silver 4316 · 256 GB ECC · 2× 1,92 TB NVMe · 25 GbE | 10 | 65 000 | 650 000 |
| Płaszczyzna sterowania Kubernetes | Dell PowerEdge R650 · 2× Xeon Silver 4310 · 128 GB · 2× 960 GB NVMe | 3 | 35 000 | 105 000 |
| Serwery HA PostgreSQL | Dell PowerEdge R750xs · 2× Xeon Gold 5318Y · 512 GB · 8× 3,84 TB NVMe RAID10 | 2 | 95 000 | 190 000 |
| Węzły klastra Redis | Dell PowerEdge R650 · Xeon Silver 4310 · 128 GB · 4× 960 GB NVMe | 3 | 30 000 | 90 000 |
| Węzły brokerów Kafka | Dell PowerEdge R750 · Xeon Silver 4316 · 128 GB · 6× 3,84 TB NVMe · KRaft | 5 | 55 000 | 275 000 |
| Macierz pamięci masowej (NAS) | NetApp AFF A400 · 200 TB surowe (50 TB użytkowe po RAID + replikacji) · 100 GbE | 1 | 280 000 | 280 000 |
| Load balancery | F5 BIG-IP i2800 · para HA · moduł WAF · SSL offload | 2 | 60 000 | 120 000 |
| Przełączniki top-of-rack | Arista 7050X3 · 32× 100 GbE | 4 | 45 000 | 180 000 |
| Przełączniki spine | Arista 7280R3 · 36× 400 GbE | 2 | 85 000 | 170 000 |
| UPS (N+1) | APC Symmetra LX 40 kVA · 15 min baterii przy pełnym obciążeniu | 2 | 50 000 | 100 000 |
| Łączny CapEx | 2 160 000 PLN (≈540 000 USD) |
Infrastruktura — roczny koszt eksploatacji (OpEx)
Utrzymanie lokalnego majątku kosztuje 2 328 000 PLN/rok (≈582 000 USD/rok).
| Kategoria | Rocznie (PLN) | Uwagi |
|---|---|---|
| Kolokacja (DC Warszawa) | 336 000 | 6 szaf, 30 kW, chłodzenie precyzyjne, podwójne łącza 10 Gbps |
| Zasilanie i chłodzenie | 102 000 | średnio 30 kW; chłodzenie przy PUE 1,4 |
| Przepustowość internetu | 108 000 | redundantny światłowód 10 Gbps, 2 ISP, failover BGP |
| Red Hat OpenShift Enterprise | 216 000 | 13 węzłów, wsparcie Red Hat, bezpieczeństwo ACM + ACS |
| Confluent Platform (Kafka) | 336 000 | licencja enterprise na 5 brokerów, Schema Registry, ksqlDB |
| HashiCorp Vault Enterprise | 72 000 | HA na 3 węzłach, seal HSM, rejestrowanie audytu |
| Konserwacja sprzętu (15% CapEx/rok) | 324 000 | Dell ProSupport+ |
| Oprogramowanie kopii zapasowych i DR | 60 000 | Veeam, niezmienne kopie zapasowe |
| Bezpieczeństwo (EDR/IDS/IPS) | 42 000 | CrowdStrike, Fortinet, Nessus |
| Inżynierowie infrastruktury (2 FTE) | 300 000 | 2 dedykowanych inżynierów seniorów |
| Amortyzacja sprzętu (5-letnia) | 432 000 | 2,16 mln PLN ÷ 5 lat |
| Łączny roczny OpEx | 2 328 000 PLN/rok | ≈582 000 USD/rok |
3-letni TCO i skalowanie
CapEx w roku 0 wynosi 2 160 000 PLN; OpEx w latach 1–3 to 2 328 000 PLN rocznie — 3-letnia suma to 9 144 000 PLN (≈2 286 000 USD). Nie ma elastycznego skalowania: sprzęt jest udostępniany pod szczytowe obciążenie od pierwszego dnia. W roku 5 wymagana jest wymiana sprzętu (dodatkowe +2 160 000 PLN).
Skalowanie lokalne jest ręczne i powolne. Węzły robocze są dodawane, gdy średnie obciążenie CPU przekracza 70% w sposób trwały przez dwa tygodnie (zamówienie trzech węzłów R750 — 8-tygodniowy czas realizacji). Szósty broker Kafka jest dodawany, gdy liczba liderów partycji brokera przekracza 200 (55 000 PLN + 1 tydzień na instalację). Zasilanie ma zapas do 45 kW, zanim trzeba rozszerzyć obszar kolokacji.
Kiedy wybrać topologię lokalną
- Najlepsza dla: maksymalnej suwerenności danych; środowisk izolowanych (air-gapped) lub o wysokim poziomie bezpieczeństwa; organizacji, które już mają centrum danych i liczny personel infrastrukturalny; środowisk regulacyjnych całkowicie zakazujących chmury (wojsko, administracja rządowa).
- Niezalecana dla: szybkiego czasu uruchomienia (poniżej 3 miesięcy); elastycznych lub nieprzewidywalnych obciążeń; zespołów, które chcą usług zarządzanych; intensywnej pracy AI/ML wymagającej Vertex AI lub BigQuery ML od GCP.
Scenariusz 2 — Pełna chmura GCP
Cała platforma działa na Google Cloud Platform w regionie europe-central2 (Warszawa, Polska), z disaster recovery w europe-west3 (Frankfurt, Niemcy). GKE Autopilot zarządza wszystkimi obciążeniami konteneryzowanymi, a usługi danych — Cloud SQL, Memorystore, Dataproc Serverless, Cloud Composer — są w pełni zarządzane przez Google.
Najważniejsze liczby: 0 USD CapEx · 13 750 USD/miesiąc (realistyczny) · 495 tys. USD 3-letniego TCO (realistyczny) · 3–4 tygodnie do uruchomienia · 100% usług zarządzanych.
Trzy podscenariusze
Pełna chmura GCP ma trzy profile kosztów zależne od obciążenia. Środkowy — Realistyczny — jest zalecaną wartością bazową.
| Podscenariusz | Miesięcznie | Rocznie | Profil |
|---|---|---|---|
| Minimalny | 8 150 USD | 97 800 USD | Dev/test lub oszczędna produkcja, ~50 aktywnych potoków, brak strumieniowego CDC, brak DR, pojedynczy region |
| Realistyczny ⭐ | 13 750 USD | 165 000 USD | Pełna produkcja, 200 aktywnych potoków, umiarkowane strumieniowanie CDC, pełne HA, ciepły standby DR |
| Pesymistyczny | 23 200 USD | 278 400 USD | Szczytowe obciążenie, intensywne CDC, aktywno-aktywne DR w obu regionach, ponad 40 TB/dzień |
Profil Minimalny jest jednoznacznie niezalecany dla produkcyjnych obciążeń Polkomtela — nie ma wysokiej dostępności ani disaster recovery.
Rozkład kosztów usług GCP (profil Realistyczny)
13 750 USD/miesiąc profilu Realistycznego rozkłada się na dwanaście kategorii usług. Poniższe wartości dotyczą wdrożenia 500+ potoków, 15–25 TB/dzień oraz 30–50 jednoczesnych wykonań.
| Kategoria | Min | Realistyczny | Pesymistyczny |
|---|---|---|---|
| 1. Obliczenia — GKE Autopilot (usługi platformy, silnik potoków, Flink, konektory, opłata za klaster) | 1 873 USD | 3 406 USD | 6 639 USD |
| 2. Dataproc — zadania wsadowe Spark + serwer historii | 729 USD | 2 652 USD | 6 924 USD |
| 3. Baza danych — Cloud SQL PG15 HA (instancja, SSD, kopie zapasowe, replika do odczytu) | 320 USD | 754 USD | 1 741 USD |
| 4. Pamięć masowa — Cloud Storage (Standard + Nearline + operacje) | 65 USD | 193 USD | 639 USD |
| 5. Komunikaty — Confluent Kafka + Pub/Sub | 2 396 USD | 4 836 USD | 9 822 USD |
| 6. Buforowanie — Memorystore Redis (główny HA + replika do odczytu) | 143 USD | 716 USD | 1 432 USD |
| 7. Orkiestracja — Cloud Composer (Airflow) | 282 USD | 565 USD | 1 130 USD |
| 8. Sieć — VPN, ruch wychodzący, NAT, load balancer, DNS | 302 USD | 590 USD | 1 959 USD |
| 9. Bezpieczeństwo — Cloud Armor, Cloud KMS, Secret Manager | 32 USD | 121 USD | 445 USD |
| 10. Operacje — Logging, Monitoring, Artifact Registry, Cloud Build | 29 USD | 89 USD | 300 USD |
11. Disaster recovery (europe-west3) | 20 USD | 872 USD | 4 270 USD |
| 12. Bufor różny (5–7%) | 79 USD | 56 USD | 464 USD |
| Łącznie miesięcznie | 8 150 USD | 13 750 USD | 23 200 USD |
| Łącznie rocznie | 97 800 USD | 165 000 USD | 278 400 USD |
Dominują dwie dźwignie kosztowe:
- Confluent Cloud Kafka to pojedyncza największa pozycja kosztowa (4 752 USD/miesiąc w profilu Realistycznym) i najbardziej negocjowalna — roczne zobowiązanie zazwyczaj daje zniżkę 30–50%.
- Koszt Dataproc Serverless jest najbardziej zmienny. „Pushdown SQL” — uruchamianie transformacji wewnątrz bazy danych źródłowej (Teradata, Snowflake) zamiast przenoszenia danych do Sparka — jest główną dźwignią kosztową.
3-letni TCO (pełna chmura GCP)
| Profil | Rok 1 | Rok 2 | Rok 3 | Suma 3-letnia |
|---|---|---|---|---|
| Minimalny | 97 800 USD | 97 800 USD | 97 800 USD | 293 400 USD |
| Realistyczny | 165 000 USD | 165 000 USD | 165 000 USD | 495 000 USD |
| Realistyczny + 3-letni CUD | 155 000 USD | 134 400 USD | 134 400 USD | 423 800 USD |
| Pesymistyczny | 278 400 USD | 278 400 USD | 278 400 USD | 835 200 USD |
CUD (Committed Use Discount) to obniżka ceny, którą Google przyznaje w zamian za zobowiązanie do 1- lub 3-letniego poziomu wykorzystania. Zastosowanie pełnego 3-letniego CUD plus instancji Spot Dataproc może obniżyć realistyczny roczny koszt GCP ze 165 000 USD do około 104 076 USD/rok — 3-letnia oszczędność około 182 772 USD. Haczyk: CUD wymagają zobowiązania z góry, a Google rozlicza zobowiązaną kwotę co miesiąc niezależnie od rzeczywistego użycia.
Kiedy wybrać pełną chmurę GCP
- Zalety: zerowy CapEx; elastyczne automatyczne skalowanie; w pełni zarządzane usługi danych (brak administracji bazą danych); region Warszawa utrzymuje dane zgodne z RODO; wbudowane DR we Frankfurcie z failoverem poniżej 60 sekund; dostęp do Claude API, Vertex AI i BigQuery ML; udostępnianie w 24–48 godzin; automatyczne łatanie; najszybszy czas uruchomienia 3–4 tygodnie.
- Wady: bieżące wydatki bez punktu „spłacenia”; koszty ruchu wychodzącego danych przy odsyłaniu wyników on-premises; zależność od internetu; skoki rachunków, jeśli obciążenia przekroczą szacunki; przeniesienie ponad 100 TB danych Teradata do GCP jest kosztowne i ryzykowne; uzależnienie od dostawcy GCP; ryzyko kursowe, ponieważ Google rozlicza się w USD.
Scenariusz 3 — Hybrydowy (zalecany)
W topologii hybrydowej bazy danych źródłowe — Teradata, Oracle, SAP HANA, MSSQL — pozostają on-premises (są już tam, a ich przeniesienie jest kosztowne i ryzykowne), podczas gdy sama platforma DataFlow AI działa na GCP europe-central2. Obie połowy są połączone dedykowanym, prywatnym łączem Google Cloud Interconnect 10 Gbps o opóźnieniu poniżej 5 milisekund.
Najważniejsze liczby: 0 USD nowego CapEx · 12 740 USD/miesiąc wydatków na GCP · 242 tys. USD łącznego kosztu rocznego · 741 tys. USD 3-letniego TCO · 10–14 tygodni do uruchomienia · opóźnienie Interconnect poniżej 5 ms.
Co pozostaje on-premises i dlaczego
| Komponent | Dlaczego pozostaje on-premises | Nowy koszt |
|---|---|---|
| Hurtownia danych Teradata | Istniejąca inwestycja, ponad 100 TB, ryzyko migracji; pushdown SQL działa w jej pobliżu | 0 USD (istniejące) |
| Baza danych Oracle ERP | Krytyczna dla biznesu; lokalna polityka regulacyjna; licencja powiązana ze sprzętem | 0 USD (istniejące) |
| SAP HANA | Licencjonowanie SAP powiązane z lokalnymi serwerami | 0 USD (istniejące) |
| Active Directory | Tożsamość korporacyjna; sfederowana z Keycloak na GCP przez LDAP | 0 USD (istniejące) |
| Agenci CDC Debezium (4 VM) | Współlokowane z bazami danych źródłowymi dla przechwytywania zmian o niskim opóźnieniu | 0 USD (istniejąca pojemność VMware) |
| Agenci maskowania PII (2 VM) | Maskują PESEL i inne dane osobowe zanim trafią do GCP | 0 USD (istniejąca pojemność VMware) |
| Lokalny bufor Kafka (3 brokery) | Pochłania skoki CDC; zachowuje zdarzenia, jeśli łącze Interconnect zostanie zerwane | 180 000 PLN/rok (lub 0 USD przy ponownym użyciu istniejących serwerów) |
| Lokalna terminacja Cloud Interconnect | Router brzegowy Cisco ASR, cross-connect w Warszawie | 7 200 PLN/miesiąc |
Kluczowa funkcja zgodności: dane osobowe są maskowane on-premises w warstwie Debezium, zanim kiedykolwiek trafią do GCP. PESEL, NIP, REGON, numery telefonów i adresy e-mail są pseudonimizowane za pomocą deterministycznego skrótu SHA-256. AI Copilot otrzymuje wyłącznie kontekst schematu — nigdy surowych danych rozliczeniowych ani klientów.
Rozkład kosztów topologii hybrydowej
Koszt platformy po stronie GCP w topologii hybrydowej jest niższy niż w pełnej chmurze — o około 7% niższy — ponieważ agenci CDC i ich buforowanie Kafka działają on-premises, redukując wydatki na GKE, Kafka i pamięć masową w GCP.
| Składnik kosztu | Rocznie |
|---|---|
| Lokalny przyrost (Interconnect, bufor Kafka, 0,5 FTE inżyniera sieci) | ~89 100 USD/rok (lub ~46 tys. USD przy istniejącym Kafka) |
| Platforma GCP (12 740 USD/miesiąc) | 152 880 USD/rok |
| Łączny roczny koszt hybrydowy | 241 980 USD/rok (≈242 000 USD) |
| Łączny — przy ponownym użyciu istniejącego lokalnego Kafka | ≈197 000 USD/rok |
3-letni TCO (hybrydowy)
| Wariant | Rok 1 | Rok 2 | Rok 3 | Suma 3-letnia |
|---|---|---|---|---|
| Hybrydowy (nowy sprzęt Kafka) | 257 000 USD (z +15 tys. USD konfiguracji Interconnect) | 242 000 USD | 242 000 USD | 741 000 USD |
| Hybrydowy (istniejący lokalny Kafka) | 212 000 USD | 197 000 USD | 197 000 USD | 606 000 USD |
Występuje jednorazowa instalacja fizycznego cross-connectu za ~15 000 USD w punkcie obecności Interconnect w Warszawie, z 6–8-tygodniowym czasem realizacji fizycznego łącza — jest to ścieżka krytyczna dla wdrożenia hybrydowego.
Kiedy wybrać topologię hybrydową
- Zalety: utrzymuje wrażliwe bazy danych źródłowych on-premises; ponownie wykorzystuje istniejącą infrastrukturę; GCP obsługuje elastyczne obliczenia, AI i analitykę; łącze Interconnect 10 Gbps jest prywatne, nie przez internet; PII jest maskowane on-premises przed dotarciem do GCP (zgodnie z RODO); progresywna ścieżka migracji; niższe koszty GCP niż w pełnej chmurze; 3-letni TCO ~606 tys. USD wobec 1,836 mln USD dla topologii lokalnej — oszczędność 1,23 mln USD.
- Wady: najbardziej złożona w konfiguracji (dwa środowiska); 6–8-tygodniowy czas realizacji Interconnect; wymaga inżynierów sieci do konfiguracji BGP/VPN/VLAN; rezydencja danych jest podzielona (metadane w GCP, dane surowe on-premises); częściowa zależność od dostępności Interconnect — choć lokalny bufor Kafka przechowuje zdarzenia lokalnie przez 48 godzin.
Dlaczego topologia hybrydowa jest zalecana dla Polkomtela
Polkomtel już posiada Teradata, Oracle i SAP HANA on-premises — koszt utopiony, który najlepiej pozostawić na miejscu, aby uniknąć ryzyka migracji. Topologia hybrydowa kosztuje 197 tys.–242 tys. USD/rok wobec 165 tys. USD/rok dla samego GCP — premia 32 tys.–77 tys. USD/rok, która kupuje suwerenność danych. W ciągu trzech lat topologia hybrydowa (741 tys. USD) wobec lokalnej (2 286 tys. USD) oszczędza 1,55 mln USD — zwrot z inwestycji powyżej 200%, a topologia hybrydowa zapewnia 73% oszczędności kosztów wobec topologii lokalnej. Uruchamia się w 10–14 tygodni zamiast 6–9 miesięcy, co ma znaczenie dla dotrzymania terminu wycofania Informatica.
Planowanie pojemności i wzrost
Trzyletni plan pojemności zakłada uruchomienie w roku 1, +30% wzrostu w roku 2 oraz +50% w roku 3.
| Metryka | Rok 1 | Rok 2 | Rok 3 | Wpływ on-premises | Wpływ GCP / hybrydowy |
|---|---|---|---|---|---|
| Aktywne potoki | 200 | 260 | 300 | Możliwe rozszerzenie węzłów K8s w roku 3 | GKE autoskaluje; +600 USD/mies. w roku 3 |
| Dzienna ilość przetwarzanych danych | 500 GB | 800 GB | 1200 GB | Zapas NetApp; monitoruj pamięć Kafka | Cloud Storage jest nieograniczone; +150 USD/mies. Dataproc w roku 3 |
| Przepustowość zdarzeń CDC (szczytowa) | 5000 eps | 8000 eps | 12 000 eps | Może wymagać 6. brokera Kafka w roku 3 | Confluent autoskaluje partycje |
| Zapytania AI Copilot/dzień | 500 | 1500 | 3000 | Wymaga API Anthropic niezależnie | Claude API +100 USD/mies. rok 2, +250 USD/mies. rok 3 |
| Jednoczesni użytkownicy | 50 | 80 | 120 | Horizontal pod autoscaler K8s sobie radzi | GKE autoskaluje |
| Węzły grafu pochodzenia | 50 000 | 150 000 | 500 000 | Strojenie pgvector potrzebne przy 500 tys. | Cloud SQL automatycznie powiększa pamięć |
Wzrost kosztów w roku 3 wynosi około +130 tys. USD CapEx i +50 tys. USD/rok OpEx dla topologii lokalnej, wobec +7 000 USD/miesiąc (~84 tys. USD/rok) dla GCP lub topologii hybrydowej. Na GCP i w topologii hybrydowej skalowanie jest automatyczne — bez udostępniania węzłów, pamięć automatycznie się powiększa, a zabezpieczenia budżetu alarmują przy 80%, 100% i 130% skonfigurowanego budżetu.
Porównanie czasu do uruchomienia
| Faza | Lokalna (on-premises) | Pełna chmura GCP | Hybrydowa |
|---|---|---|---|
| Udostępnianie infrastruktury | 6–12 tyg. (zakup sprzętu) | 2–5 dni (terraform apply) | 6–8 tyg. (fizyczne łącze Cloud Interconnect) |
| Wdrożenie platformy | 4–8 tyg. | 1–2 tyg. | 2–3 tyg. |
| Łączność i bezpieczeństwo | 2–4 tyg. | 1 tyg. | 3–4 tyg. |
| Pierwszy potok w produkcji | 14–24 tyg. | 3–4 tyg. | 10–14 tyg. |
| Pełna produkcja (wszystkie potoki) | 6–9 miesięcy | 2–3 miesiące | 4–6 miesięcy |
| Poziom ryzyka | Wysoki (zakupy, awaria sprzętu) | Niski (zarządzany, automatyczne odzyskiwanie) | Średni (złożoność sieci) |
| Wymagania zespołu | 2+ FTE dedykowanych inżynierów infrastruktury | 0,5 FTE administratora GCP | 0,5 FTE sieci + 0,25 FTE administratora GCP |
Bezpieczeństwo i zgodność z RODO w poszczególnych scenariuszach
RODO to polska implementacja GDPR. Poniższa tabela pokazuje, jak każda topologia spełnia kluczowe wymagania zgodności (✓ Pełne / ⚠ Częściowe).
| Wymaganie | On-prem | Pełne GCP | Hybrydowa |
|---|---|---|---|
| RODO (polskie GDPR) | ✓ wszystkie dane on-premises | ✓ GCP europe-central2 Warszawa | ✓ PII maskowane przed GCP |
| Regulacje telekomunikacyjne UKE | ✓ | ⚠ częściowo — zweryfikować z działem prawnym | ✓ CDR / surowe dane telekomunikacyjne pozostają on-premises |
| SOC 2 Type II | ⚠ ręczna implementacja + audyt | ✓ dziedziczy certyfikację GCP | ✓ GCP objęte, on-premises ręcznie |
| ISO 27001 | ⚠ ręczny audyt | ✓ GCP certyfikowane | ⚠ częściowo |
| Szyfrowanie w spoczynku | ✓ seal HSM Vault | ✓ Cloud KMS CMEK | ✓ oba |
| Szyfrowanie w tranzycie | ✓ wewnętrzne mTLS | ✓ Google TLS 1.3 | ✓ MACsec Interconnect + mTLS |
| Segmentacja sieci (zero-trust) | ⚠ ręczne VLAN + zapora | ✓ VPC Service Controls | ✓ GCP VPC + lokalny VLAN |
| Rejestrowanie audytu (niezmienne) | ⚠ ręczny SIEM ELK + Wazuh | ✓ Cloud Audit Logs (400-dniowa retencja) | ✓ oba |
| Ochrona przed DDoS | ⚠ FortiGate IPS | ✓ Cloud Armor Enterprise | ✓ Cloud Armor |
| Zapobieganie utracie danych | ⚠ ręczne polityki | ✓ Cloud DLP + nadzór DataFlow | ✓ maskowanie Debezium + Cloud DLP |
Wszystkie trzy topologie współdzielą te same funkcje bezpieczeństwa DataFlow AI: Keycloak 24 dla OIDC/SAML z federacją Active Directory i MFA; HashiCorp Vault dla dynamicznych 30-minutowych poświadczeń bazy danych; RBAC w API Gateway z 5 rolami i 26 uprawnieniami; domyślnie odmawiające polityki sieciowe Kubernetes; oraz 30-dniową rotację wszystkich haseł baz danych, kluczy API i poświadczeń Kafka.
W przypadku disaster recovery dwa dokumenty źródłowe podają różne wartości docelowe — należy odnotować rozbieżność:
- Dokument scenariuszy wdrożenia podaje ciepły cel DR na GCP: RTO < 60 sekund, RPO < 30 sekund.
- Dokument analizy kosztów GCP podaje RTO < 4 godziny, RPO < 15 minut dla tej samej konfiguracji DR.
Przewodnik decyzyjny — wybór topologii
Dokument źródłowy dostarcza schemat decyzyjny. Przejdź przez te pytania po kolei:
Q1. Do regulations require ALL data to stay on-premises?
YES -> On-Premises (military / government air-gap)
NO -> go to Q2
Q2. Are there large existing on-prem databases (Teradata / Oracle / SAP HANA)?
YES -> go to Q3
NO -> go to Q4
Q3. Is data transfer to the cloud acceptable, given PII masking on-prem first?
YES -> HYBRID (recommended)
NO -> On-Premises
Q4. Is the budget under $200K/year?
YES -> GCP Full Cloud (Minimum or Realistic)
NO -> GCP Full Cloud (Realistic or Pessimistic)
Ścieżka Polkomtel Plus przez ten schemat: Q1 = Nie (regulacje dopuszczają chmurę), Q2 = Tak (duże majątki Teradata, Oracle i SAP HANA już on-premises), Q3 = Tak (transfer jest dopuszczalny przy maskowaniu PII on-premises) → Hybrydowa.
Podsumowanie porównawcze
| Czynnik | Lokalna (on-premises) | Pełna chmura GCP | Hybrydowa ⭐ |
|---|---|---|---|
| CapEx początkowy | 2,16 mln PLN (~540 tys. USD) | 0 USD | 0 USD nowego |
| 3-letni TCO | ~2 286 000 USD | ~495 000 USD (realistyczny) | ~606 000–741 000 USD |
| Czas do pierwszego potoku | 14–24 tygodnie | 3–4 tygodnie | 10–14 tygodni |
| Elastyczne skalowanie | Nie — stały sprzęt | Tak — w pełni automatyczne | Tak — platforma GCP skaluje |
| Suwerenność danych | Maksymalna | Region GCP Warszawa | Dane źródłowe on-premises, metadane w GCP |
| Dedykowany personel | 2+ FTE inżynierów infrastruktury | 0,5 FTE | 0,75 FTE |
| Najlepsze dopasowanie | Air-gapped / regulacyjny zakaz chmury | Greenfield, kierowane budżetem, szybkie uruchomienie | Duże istniejące bazy danych on-premises |
Dwie rzeczywistości wdrożeniowe
Powyższe topologie opisują zamierzoną architekturę GCP opartą na GKE. Bieżące działające wdrożenie produkcyjne platformy to pojedynczy VPS z systemem Debian uruchamiający Docker Compose — nie GKE i nie wieloregionowe. Mechanikę budowy i udostępniania tego, co faktycznie działa dzisiaj, opisuje strona Wdrożenie i udostępnianie.
Co dalej
- Uzasadnienie biznesowe, ROI oraz ekonomię migracji stojącą za wyborem topologii znajdziesz na stronie Wartość biznesowa i ROI.
- Rzeczywisty proces budowy, wydania i udostępniania — w tym działające wdrożenie na VPS — opisuje strona Wdrożenie i udostępnianie.
- Zadania administracyjne po uruchomieniu topologii opisuje Przewodnik administratora.