Szkolenie Streaming danych w Google Cloud Platform

Poziom

Średniozaawansowany

Czas

24h / 3 dni

Termin

Indywidualnie

Cena

Indywidualnie

Szkolenie Streaming danych w Google Cloud Platform

Poznaj praktyczne podejście do projektowania, budowania i utrzymywania pipeline’ów danych w czasie rzeczywistym na Google Cloud Platform. Podczas szkolenia nauczysz się podejmować świadome decyzje dotyczące wyboru pomiędzy przetwarzaniem batchowym, micro-batchem i streamingiem oraz poznasz cały proces budowy rozwiązania – od przygotowania źródła danych i CDC, przez streaming i przetwarzanie danych w Dataflow, aż po monitoring, SLO i procedury operacyjne. Szkolenie ma charakter praktyczny i opiera się na realizacji projektu, który uczestnicy rozwijają krok po kroku podczas kolejnych bloków. Poznasz najważniejsze zagadnienia związane z CDC, Datastream, Dataflow i Apache Beam, a także dowiesz się, jak projektować pipeline’y odporne na duplikaty, retry, zmiany schematów i dane spóźnione. Po zakończeniu szkolenia będziesz potrafić świadomie projektować architekturę przepływu danych, budować pipeline’y streamingowe oraz przygotować je do stabilnej pracy i monitorowania w środowisku produkcyjnym.

Dla kogo jest to szkolenie?
  • logo infoshare Data Engineerów
  • logo infoshare Inżynierów danych pracujących z Google Cloud Platform
  • logo infoshare Developerów pracujących z systemami przetwarzania i integracji danych
  • logo infoshare Architektów danych
Czego nauczysz się na szkoleniu?
  • logo infoshare Podejmowania decyzji dotyczących wyboru batch processingu, micro-batchingu i streamingu
  • logo infoshare Projektowania architektury pipeline’u danych i definiowania SLO
  • logo infoshare Przygotowywania źródeł danych do Change Data Capture
  • logo infoshare Konfigurowania i wykorzystywania Datastream
  • logo infoshare Budowania pipeline’ów streamingowych z wykorzystaniem Dataflow i Apache Beam
  • logo infoshare Pracy z oknami, watermarkami i late data
  • logo infoshare Implementowania deduplikacji i enrichmentu danych
  • logo infoshare Testowania pipeline’ów i przygotowywania ich do pracy produkcyjnej
  • logo infoshare Monitorowania pipeline’ów oraz tworzenia runbooków i procedur operacyjnych

Program szkolenia

Dzień 1

 

Moduł I: Fundamenty + decyzje architektoniczne + start projektu

Cel: ustawić wspólny język, kryteria wyboru i plan “co budujemy i po co”.

  • Batch vs streaming: kompromisy (latencja/koszt/złożoność/utrzymanie) + kiedy nie robić streamingu
  • Modele dostarczania: CDC vs event sourcing vs micro-batch vs near real-time (w praktyce DE)
  • “Klocki” GCP i kryteria wyboru (bez wchodzenia w szczegóły narzędzi): Pub/Sub, Dataflow, Cloud Run, Datastream, (Debezium/Kafka jako kontekst)
  • Projekt (start): wybór case’u + definicja SLO (lag/latencja, np. p95), założenia, ryzyka, budżet kosztowy, kryteria “done”

Output: karta architektury (warianty + uzasadnienie) + wstępne SLO i ryzyka.

 

Moduł II: CDC od strony źródła – checklisty “dla DBA” + lab w bazie

Cel: zapewnić, że CDC jest wykonalne i bezpieczne dla produkcji.

  • Mechanika CDC na źródłach: MySQL binlog / SQL Server CDC/CT / Oracle redo logs – co musi być włączone i konsekwencje
  • Uprawnienia i wymagania organizacyjne: checklista “co musi zrobić admin/DBA” + typowe blokery
  • Problemy praktyczne: schema changes, brak PK, kolizje typów, wolne OLTP (“nie psujemy produkcji”)
  • Lab: przygotowanie źródła CDC (MySQL lub SQL Server) + test “czy CDC działa” + co logujemy/monitorujemy po stronie źródła

Output: gotowa checklista wdrożeniowa + wnioski “source constraints”.

 

Dzień 2

 

Moduł III: Datastream – tylko essentials + poprawne landing + pomiar SLO

Cel: wykorzystać Datastream jako znany element i ustawić “czyste wejście” do downstream.

  • Datastream w pigułce: co robi, czego nie robi; jak czytać statusy, lag, throughput
  • Minimalna konfiguracja: connection profiles, wybór obiektów, pułapki (najczęstsze przyczyny laga/błędów)
  • Datastream → GCS/BQ: landing (formaty/naming), zasady “bronze layer” pod downstream
  • Lab: uruchomienie streamu + pierwsze dane w GCS/BQ + baseline SLO (lag/latencja) + metryki do monitoringu

Output: działający stream + zasady lądowania + baseline SLO.

 

Moduł IV: Dataflow/Beam streaming – okna, watermarki, late data (praktycznie)

Cel: zbudować stabilny pipeline streamingowy i zrozumieć, co się psuje bez okien/watermarków.

  • Beam streaming fundamentals: unbounded sources, model przetwarzania ciągłego
  • Okna, watermarki, late data: przykłady błędów (duplikaty, “dziury”, złe agregacje) i naprawa
  • Transformacje w locie: mapowanie do schematu BigQuery, podstawy schema evolution “bez niespodzianek”
  • Lab: wejście (GCS/PubSub – zależnie od wariantu) → Dataflow → BQ: prosta transformacja + kontrola opóźnień

Output: pipeline streaming → BQ, działający na danych z projektu.

 

Dzień 3

 

Moduł V: Wzorce Dataflow – deduplikacja, enrichment, micro-batch + testowalność

Cel: dowieźć “produkcyjność”: odporność na retrysy, powtórki i realne dane.

  • Deduplikacja i exactly-once-ish: retrysy, powtórki, brak PK – strategie kluczy i okien
  • Enrichment: lookup do BigQuery/HTTP/cache – kiedy ma sens, kiedy zabija koszty/latencję
  • Micro-batch jako kompromis koszt/latencja (near real-time bez platformy)
  • Testowalność: mini-zestaw testów/regresji dla pipeline’u (co warto testować naprawdę)
  • Lab: deduplikacja + enrichment + zapis do BQ + testy/regresje (minimalny, sensowny zestaw)

Output: pipeline “hardened” + testy + decyzja o micro-batch (tak/nie) z uzasadnieniem.

 

Moduł VI: Operacje/SLO + monitoring + runbook + alternatywy i domknięcie projektu

Cel: domknąć temat operacyjnie (SLO, alerty, runbook), plus świadomie wybrać alternatywy/hybrydę.

  • Orkiestracja: Composer (Airflow) – uruchamianie Dataflow, health-checki, zależności batch+stream
  • Monitoring i alerting: lag/throughput, błędy CDC, koszty (Datastream+Dataflow), “source vs GCP issue”
  • Runbooki: bezpieczne restarty, procedury eskalacji, definicja “done”, checklisty awaryjne
  • Alternatywy/hybryda (krótko, decyzyjnie): Pub/Sub + Cloud Run + Dataflow; ingestion przez API; Debezium/Kafka/Confluent – kiedy ma sens vs overkill
  • Finał projektu: end-to-end demo + dashboardy + runbook na scenariusze (lag rośnie / schema się zmienia / retry storm)

Output: gotowy runbook + monitoring/SLO + decyzje architektoniczne “co odpuszczamy”.

Skontaktuj sie z nami

zorganizujemy dla Ciebie szkolenie dopasowane do Twoich potrzeb

Przemysław Wołosz

Key Account Manager

przemyslaw.wolosz@infoShareAcademy.com

    Administratorem danych osobowych jest InfoShare Academy Sp. z o.o. z siedzibą w Gdańsku, al. Grunwaldzka 427B, 80-309 Gdańsk, KRS: 0000531749, NIP: 5842742213. Dane osobowe przetwarzane są zgodnie z klauzulą informacyjną.