Szkolenie Analiza i Insights z danych tekstowych
Poziom
ZaawansowanyCzas
16h / 2 dniTermin
IndywidualnieCena
IndywidualnieSzkolenie Analiza i Insights z danych tekstowych
Dwudniowe, praktyczne szkolenie poświęcone przekształcaniu nieustrukturyzowanych danych tekstowych w mierzalne insighty biznesowe z wykorzystaniem Pythona i technik NLP. Uczestnicy przygotują powtarzalny potok przetwarzania tekstu, zastosują ekstrakcję encji i kluczowych informacji, porównają klasyczne modele uczenia maszynowego z gotowymi modelami transformerowymi oraz zbudują prototyp klasyfikacji dokumentów lub analizy sentymentu. Program obejmuje walidację wyników, analizę błędów, reprodukowalność eksperymentów oraz ocenę ograniczeń związanych z jakością danych, stronniczością, prywatnością i wykorzystaniem modeli generatywnych .
Dla kogo jest szkolenie z Analiza i Insights z danych tekstowych?
Analityków biznesowych i specjalistów business intelligence wykorzystujących Python do analizy danych oraz automatyzacji raportowania
Analityków danych i data scientistów pracujących z dokumentami, opiniami klientów, zgłoszeniami, wiadomościami lub innymi danymi tekstowymi
Programistów i inżynierów danych przygotowujących prototypy potoków NLP, klasyfikatorów tekstu oraz mechanizmów ekstrakcji informacji
Technicznych product managerów, konsultantów i specjalistów z obszarów marketingu, finansów lub obsługi klienta, którzy samodzielnie analizują dane w Pythonie.
Uczestników znających funkcje, kolekcje, pracę z plikami i biblioteką pandas oraz podstawowe pojęcia uczenia maszynowego: cecha, etykieta, zbiór treningowy, zbiór testowy i metryka jakości
Czego się nauczysz na szkoleniu Analiza i Insights z danych tekstowych?
- Zbudujesz powtarzalny notebook obejmujący wczytanie, kontrolę jakości, czyszczenie, normalizację i reprezentację danych tekstowych
- Wyodrębnisz encje, kluczowe frazy i informacje domenowe oraz zapiszesz wyniki w ustrukturyzowanej tabeli gotowej do dalszej analizy
- Porównasz klasyczne reprezentacje tekstu z gotowymi modelami transformerowymi i dobierzesz podejście do celu, jakości danych oraz dostępnych zasobów
- Zbudujesz i ocenisz prototyp klasyfikacji dokumentów lub analizy sentymentu z wykorzystaniem podziału danych, metryk precision, recall i F1 oraz macierzy pomyłek
- Przygotujesz mini-projekt NLP zawierający problem biznesowy, potok danych, wynik modelu, analizę błędów, ograniczenia rozwiązania i rekomendacje dalszego monitorowania
Program szkolenia
Dzień 1: Fundamenty NLP i Przygotowanie Danych
Moduł 1: Wprowadzenie do NLP w biznesie
- Kluczowe koncepcje przetwarzania języka naturalnego: dokument, token, korpus, cecha, embedding, encja, klasyfikacja, generowanie tekstu oraz różnice między analizą statystyczną a interpretacją biznesową
- Praktyczne scenariusze zastosowań NLP w różnych branżach: klasyfikacja dokumentów, analiza opinii, routing zgłoszeń, wyszukiwanie semantyczne, ekstrakcja danych oraz identyfikacja ograniczeń i ryzyk
Moduł 2: Przygotowanie środowiska programistycznego
- Środowisko Python dla NLP: wersja interpretera, Jupyter Notebook, struktura projektu, obsługa plików tekstowych oraz kontrola poprawności konfiguracji
- Biblioteki NLP: NLTK, spaCy, Gensim, scikit-learn oraz ekosystem gotowych modeli transformerowych, wraz z kryteriami doboru narzędzi do zadania
- Wirtualne środowiska programistyczne: izolacja zależności, pliki wymagań, wersjonowanie pakietów, ziarna losowości oraz podstawy reprodukowalności eksperymentów
Moduł 3: Wstępne przetwarzanie danych tekstowych
- Czyszczenie i normalizacja tekstu: kodowanie znaków, znaczniki HTML, adresy URL, znaki specjalne, wielkość liter, duplikaty, braki danych oraz dane wrażliwe
- Tokenizacja, słowa funkcyjne i lematyzacja: warianty językowe, znaki interpunkcyjne, formy fleksyjne oraz wpływ transformacji na zachowanie znaczenia
- Praktyczne ćwiczenia transformacji surowych danych tekstowych: potok przetwarzania, testy jakości, statystyki korpusu oraz porównanie danych przed i po normalizacji
Moduł 4: Ekstrakcja informacji
- Rozpoznawanie nazw własnych (NER): gotowe modele, reguły domenowe, typy encji, konflikty dopasowań oraz metryki precision, recall i F1
- Identyfikacja kluczowych fraz i relacji: częstość terminów, n-gramy, reprezentacja TF-IDF, wzorce językowe oraz ocena przydatności wyników
- Praktyczne scenariusze ekstrakcji danych z dokumentów biznesowych: schemat danych wynikowych, walidacja próbek, obsługa wyjątków oraz kontrola poufności informacji
Dzień 2: Zaawansowane techniki NLP
Moduł 5: Zaawansowane modele NLP
- Podstawy sieci neuronowych w NLP: reprezentacje wektorowe, warstwy modelu, proces uczenia, funkcja straty, dane treningowe oraz ograniczenia obliczeniowe
- Transformery – architektura i zastosowania: mechanizm uwagi, tokenizacja, embeddingi kontekstowe, modele enkoderowe i generatywne, okno kontekstowe oraz koszt inferencji
- Praktyczne zastosowania modeli BERT i GPT w analizie biznesowej: klasyfikacja, embeddingi, ekstrakcja informacji, podejście zero-shot i few-shot, halucynacje, prywatność danych oraz nadzór człowieka
Moduł 6: Klasyfikacja tekstu
- Algorytmy klasyfikacji tekstu: naiwny klasyfikator Bayesa, regresja logistyczna, maszyny wektorów nośnych, reprezentacja TF-IDF oraz gotowe modele transformerowe
- Konstrukcja modeli uczenia maszynowego dla kategoryzacji dokumentów: definicja etykiet, podział warstwowy, niezbalansowane klasy, ryzyko wycieku danych, metryki jakości oraz progi decyzyjne
- Warsztaty: projekt klasyfikacji dokumentów firmowych, potok cech, model bazowy, walidacja, macierz pomyłek, analiza błędów oraz zapis artefaktów eksperymentu
Moduł 7: Analiza sentymentu
- Podstawowe modele sentymentu: metody leksykalne, klasyczne klasyfikatory, gotowe modele transformerowe, polaryzacja, intensywność oraz analiza aspektowa
- Analiza opinii klientów w kontekście biznesowym: język domenowy, negacja, ironia, wielojęzyczność, agregacja wyników oraz interpretacja wskaźników
- Warsztaty: projekt analizy sentymentu dla wybranej branży, zbiór testowy, metryki jakości, analiza pomyłek, ryzyko stronniczości oraz granice automatycznych rekomendacji
Moduł 8: Projekt końcowy
- Samodzielny mini-projekt NLP: pytanie biznesowe, zbiór danych, potok przetwarzania, metoda analityczna, metryka sukcesu oraz wynik w formie ustrukturyzowanego insightu
- Prezentacja rozwiązań: założenia, wyniki, dowody jakości, ograniczenia, reprodukowalność, użyteczność decyzyjna oraz rekomendacje dalszego rozwoju
- Indywidualne konsultacje i feedback: przegląd kodu, analiza błędów, ryzyka danych i modeli, podstawy monitorowania jakości oraz kolejne etapy pracy nad rozwiązaniem