Szkolenie SpaCy
Poziom
ŚredniozaawansowanyCzas
16h / 2 dniTermin
IndywidualnieCena
IndywidualnieSzkolenie SpaCy
Szkolenie ze spaCy to dwudniowy, praktyczny kurs poświęcony analizie i przetwarzaniu tekstu w Pythonie. Uczestnicy skonfigurują środowisko, wykorzystają gotowe potoki językowe oraz przeanalizują tokeny, zdania, formy gramatyczne, zależności składniowe i encje. Następnie przygotują prototyp klasyfikatora tekstu, obejmujący dane treningowe, konfigurację eksperymentu, walidację i ocenę jakości. Około 80% czasu zajmują ćwiczenia prowadzące do powstania notebooka analitycznego i eksperymentalnego modelu NLP.
Dla kogo jest szkolenie SpaCy?
Programiści Python i inżynierowie danych zainteresowani tworzeniem potoków przetwarzania tekstu oraz integracją komponentów NLP z aplikacjami
Data scientiści i analitycy danych przygotowujący dane tekstowe, ekstrakcję informacji, klasyfikację dokumentów lub analizę opinii
Specjaliści IT automatyzujący przetwarzanie wiadomości, zgłoszeń, dokumentów, opisów produktów i innych nieustrukturyzowanych danych tekstowych
Wymagane umiejętności technologiczne:
Znajomość Pythona obejmująca funkcje, kolekcje, instrukcje warunkowe, pętle, import modułów oraz odczyt danych z plików
Umiejętność pracy ze środowiskiem wirtualnym, menedżerem pakietów pip oraz notebookiem Jupyter lub wybranym IDE
Podstawowa znajomość przetwarzania danych tabelarycznych oraz pojęć zbioru treningowego, walidacyjnego, etykiety i metryki jakości
Czego nauczysz się na szkoleniu SpaCy?
- Skonfigurujesz środowisko spaCy, dobierzesz potok językowy i utworzysz program przetwarzający kolekcję dokumentów tekstowych
- Wyodrębnisz tokeny, zdania, lematy, cechy morfologiczne, części mowy, zależności składniowe oraz encje i zapiszesz wyniki w ustrukturyzowanej formie
- Połączysz komponenty statystyczne z regułami, przeanalizujesz typowe błędy oraz ocenisz wpływ jakości danych, języka i domeny na wyniki
- Przygotujesz i ocenisz prototyp klasyfikatora tekstu, w tym klasyfikatora sentymentu, z użyciem podziału danych, konfiguracji treningu i właściwych metryk
Program szkolenia
Dzień 1: Podstawy NLP i środowisko spaCy
Moduł 1: Podstawy przetwarzania języka naturalnego (NLP)
- Wprowadzenie do NLP: reprezentacja tekstu, ekstrakcja informacji, klasyfikacja dokumentów, analiza opinii oraz granice automatycznej interpretacji języka
- Przegląd narzędzi i technik NLP: metody regułowe, modele statystyczne, potoki językowe, modele transformerowe oraz kryteria doboru rozwiązania
Moduł 2: Wprowadzenie do spaCy
- Instalacja i konfiguracja spaCy: środowisko wirtualne, pakiety językowe, zależności, obsługa CPU i GPU oraz weryfikacja konfiguracji
- Przegląd architektury spaCy: obiekty Language, Doc, Span i Token, słownik współdzielony oraz kolejność komponentów potoku
Moduł 3: Podstawowe operacje w spaCy
- Tokenizacja i segmentacja zdań: reguły podziału tekstu, wyjątki językowe, znaki specjalne oraz kontrola granic tokenów i zdań
- Lematyzacja i stop words: formy podstawowe wyrazów, listy słów funkcyjnych, konfiguracja językowa oraz ograniczenia automatycznego usuwania tokenów
- Analiza morfologiczna: części mowy, cechy fleksyjne, właściwości tokenów oraz interpretacja adnotacji językowych
Moduł 4: Analiza tekstu za pomocą spaCy
- Implementacja potoku analitycznego: przetwarzanie pojedynczych dokumentów i kolekcji tekstów, komponenty aktywne, przetwarzanie wsadowe oraz zapis wyników
- Analiza zbiorów danych tekstowych: normalizacja wejścia, statystyki dokumentów, kontrola braków i anomalii oraz jakościowa analiza błędów
Dzień 2: Analiza językowa, encje i modele klasyfikacyjne
Moduł 5: Analiza składniowa i semantyczna
- Części mowy i analiza składniowa: znaczniki POS, cechy morfologiczne, struktura zdania oraz zależność wyników od języka i domeny tekstu
- Zależności i drzewa składniowe: relacje między tokenami, korzenie zdań, wizualizacja struktur oraz walidacja wyników na przykładach domenowych
Moduł 6: Rozpoznawanie nazw własnych (NER) i klasyfikacja sentymentu
- Rozpoznawanie nazw własnych: gotowy komponent NER, typy encji, reguły EntityRuler, konflikty dopasowań oraz ocena precyzji i kompletności
- Klasyfikacja sentymentu: komponenty textcat i textcat_multilabel, etykiety klas, progi decyzyjne, metryki jakości, błędy domenowe oraz ryzyko stronniczości danych
Moduł 7: Modele NLP z użyciem spaCy
- Model klasyfikacji tekstu: format danych, zbiory treningowy i walidacyjny, konfiguracja komponentu, proces treningu, strojenie podstawowych parametrów oraz analiza pomyłek
- Korpusy i konfiguracja eksperymentu: jakość adnotacji, reprezentatywność próbek, plik konfiguracyjny, ziarno losowości, metryki, wersjonowanie artefaktów oraz podstawy monitorowania jakości modelu