Szkolenie Google BigQuery
Poziom
ŚredniozaawansowanyCzas
16h / 2 dniTermin
IndywidualnieCena
IndywidualnieSzkolenie Google BigQuery
Dwudniowe, praktyczne szkolenie poświęcone pracy z BigQuery – w pełni zarządzaną, bezserwerową hurtownią danych w Google Cloud. Uczestnicy skonfigurują projekt i uprawnienia, utworzą zbiory danych oraz tabele, przygotują zapytania GoogleSQL, zoptymalizują przetwarzanie za pomocą partycjonowania i klastrowania oraz zbudują prosty proces zasilania danych. Program obejmuje integracje z Cloud Storage, MySQL, PostgreSQL, Arkuszami Google, narzędziami BI i Pythonem, a także podstawy BigQuery ML, kontroli kosztów, jakości danych, bezpieczeństwa i reprodukowalności.
Dla kogo jest szkolenie Google BigQuery?
Dla architektów rozwiązań i specjalistów hurtowni danych projektujących analityczne środowiska w Google Cloudarchitektów rozwiązań i specjalistów w zakresie hurtowni danych
Dla analityków danych tworzących zapytania, zestawy danych, raporty oraz cykliczne analizy biznesowe
Dla inżynierów danych odpowiedzialnych za zasilanie hurtowni, integrację źródeł, automatyzację zapytań i udostępnianie danych odbiorcom
Dla osób znających SQL w zakresie SELECT, WHERE, GROUP BY, HAVING, ORDER BY, JOIN i podzapytań oraz rozumiejących podstawowe pojęcia relacyjnych baz danych
Czego nauczysz się na szkoleniu Google BigQuery?
- Skonfigurujesz projekt, zbiór danych, konto serwisowe i role IAM oraz przygotujesz podstawowe mechanizmy kontroli dostępu i kosztów
- Utworzysz tabele i widoki oraz napiszesz zapytania GoogleSQL zawierające złączenia, agregacje, CTE, tablice, struktury i funkcje daty
- Przygotujesz proces zasilania BigQuery z Cloud Storage, relacyjnej bazy danych lub Arkuszy Google oraz skonfigurujesz cykliczne zapytanie z kontrolą jego wykonania
- Zbudujesz raport oparty na danych z BigQuery oraz prototyp modelu BigQuery ML zawierający dane treningowe, metryki jakości, wynik predykcji i opis ograniczeń
Program szkolenia
Dzień 1
Moduł 1: Fundamenty Google Cloud i BigQuery
- BigQuery w architekturze Google Cloud: warstwa składowania, zasoby obliczeniowe, model bezserwerowy, GoogleSQL oraz scenariusze analityczne
- Usługi komplementarne Google Cloud: Cloud Storage, Pub/Sub, Dataflow, Dataform, Cloud Run oraz kryteria doboru komponentów
- Fundamenty projektu chmurowego: projekt, konto rozliczeniowe, interfejsy API, lokalizacja danych, role IAM, konta serwisowe, budżety i alerty kosztowe
- Fundamenty hurtowni danych: systemy OLTP i OLAP, fakty, wymiary, schemat gwiazdy, procesy ETL i ELT oraz separacja składowania od obliczeń
Moduł 2: Podstawy GoogleSQL w BigQuery
- Zbiory danych, tabele, widoki i zadania: hierarchia zasobów, identyfikatory obiektów, lokalizacja danych oraz historia wykonania zapytań
- BigQuery Studio: eksplorator zasobów, edytor GoogleSQL, wyniki zapytań, szczegóły wykonania, estymacja przetwarzanych danych oraz diagnostyka błędów
- Cloud Shell i narzędzie bq: konfiguracja projektu, polecenia CLI, parametry zadań, formaty wyników oraz podstawy automatyzacji
- Zapytania SELECT: wybór kolumn, aliasy, wyrażenia, wartości unikalne, ograniczenie liczby rekordów oraz podgląd schematu
- Filtry i porządek wyników: klauzule WHERE i ORDER BY, operatory logiczne, wartości NULL, zakresy, wzorce tekstowe oraz kolejność sortowania
- Agregacje danych: funkcje COUNT, SUM, AVG, MIN i MAX, klauzule GROUP BY i HAVING oraz kontrola poziomu szczegółowości
Moduł 3: Zbiory danych i tabele
- Zbiory danych: nazewnictwo, lokalizacja regionalna i wieloregionalna, domyślny czas wygaśnięcia tabel, etykiety oraz zakres uprawnień
- Tabele natywne: schemat, automatyczne rozpoznawanie kolumn, instrukcje CREATE TABLE i CREATE OR REPLACE TABLE, widoki oraz materializowane wyniki zapytań
- Typy i tryby danych: STRING, INT64, NUMERIC, BOOL, DATE, DATETIME, TIMESTAMP, JSON, GEOGRAPHY, pola wymagane, opcjonalne i powtarzalne
- Tablice i struktury: typy ARRAY i STRUCT, dane zagnieżdżone i powtarzalne, notacja pól oraz modelowanie rekordów półustrukturyzowanych
- Partycjonowanie, klastrowanie i tabele z symbolami wieloznacznymi: partycje czasowe i całkowitoliczbowe, filtry partycji, kolejność kolumn klastrowania, eliminacja bloków oraz kontrola kosztu zapytań
Moduł 4: Zasilanie danych i automatyzacja
- Architektura procesów ETL i ELT: źródła, strefa pośrednia, tabele docelowe, pełne i przyrostowe zasilanie, idempotencja oraz kontrola jakości
- Publiczne zbiory danych BigQuery: katalog zasobów, lokalizacja tabel, schematy, warunki wykorzystania oraz koszty wykonywania zapytań
- Cloud Storage i dane zewnętrzne: pliki CSV, JSON, Avro i Parquet, zadania ładowania, wykrywanie schematu, tabele zewnętrzne oraz zgodność lokalizacji
- Źródła MySQL i PostgreSQL: BigQuery Data Transfer Service, zapytania federacyjne, mapowanie typów, częstotliwość transferów oraz kontrola kompletności danych
- Google Drive i Arkusze Google: tabele zewnętrzne, zakres danych, schemat kolumn, poświadczenia oraz ograniczenia wydajności i współdzielenia
- BigQuery API i Storage Write API: zadania wsadowe, strumieniowe zasilanie, identyfikatory strumieni, atomowe zatwierdzenie oraz obsługa błędów
- BigQuery Data Transfer Service: konektory zarządzane, konfiguracje transferów, harmonogramy, uzupełnienie danych historycznych, regiony oraz monitoring wykonania
- Scheduled Queries i Dataform: cykliczne zapytania GoogleSQL, tabele docelowe, parametry czasu, konta wykonawcze, zależności, testy oraz historia uruchomień
Dzień 2
Moduł 5: GoogleSQL w praktyce
- Złączenia tabel: INNER JOIN, LEFT JOIN, FULL JOIN i CROSS JOIN, klucze złączeń, kardynalność, wartości puste oraz ryzyko powielania rekordów
- Common Table Expressions: klauzula WITH, etapy transformacji, ponowne użycie wyników, czytelność zapytania oraz diagnostyka logiki
- Tablice i dane zagnieżdżone: funkcje ARRAY_AGG, ARRAY, UNNEST, podzapytania skorelowane oraz agregacje elementów struktur
- Data i czas: typy DATE, DATETIME i TIMESTAMP, strefy czasowe, funkcje ekstrakcji i formatowania, różnice okresów oraz kalendarze raportowe
- Zapisane zapytania BigQuery Studio: zasoby kodu oparte na Dataform, współdzielenie, uprawnienia, historia zmian, nazewnictwo oraz standardy pracy zespołowej
Moduł 6: Raporty i wizualizacje
- Connected Sheets: połączenie Arkuszy Google z BigQuery, tabele przestawne, formuły, ekstrakty, odświeżanie oraz zakres danych dostępnych dla odbiorcy
- Data Studio, wcześniej Looker Studio: połączenie źródła, wymiary, metryki, filtry, zakresy dat, dashboard oraz kontrola kosztu zapytań
- Power BI i Tableau: konektory BigQuery, uwierzytelnianie, tryby dostępu, redukcja zakresu danych, agregacje źródłowe oraz podstawy akceleracji za pomocą BI Engine
Moduł 7: Integracje, BigQuery ML i jakość rozwiązań
- BigQuery API i biblioteki klienckie Google Cloud: zadania zapytań, parametry, wyniki stronicowane, obsługa wyjątków, limity oraz diagnostyka operacji
- Python, pandas i Jupyter: biblioteka google-cloud-bigquery, obiekty DataFrame, uwierzytelnianie lokalne, przetwarzanie wyników oraz kontrola zużycia pamięci
- Konta serwisowe i narzędzia zewnętrzne: Application Default Credentials, role minimalne, klucze i poświadczenia, DataGrip, sekrety oraz audyt dostępu
- BigQuery ML: regresja liniowa, prognozy ARIMA_PLUS i TimesFM, instrukcja CREATE MODEL, funkcje oceny i predykcji, podział danych, metryki, wyciek informacji, ograniczenia modelu oraz podstawy monitorowania jakości