Szkolenie Natural Language Toolkit (NLTK)
Poziom
ŚredniozaawansowanyCzas
16h / 2 dniTermin
IndywidualnieCena
IndywidualnieSzkolenie Natural Language Toolkit
Szkolenie z NLTK to dwudniowy, praktyczny kurs poświęcony analizie i przetwarzaniu tekstu w Pythonie. Uczestnicy przygotują środowisko i zasoby językowe, zbudują potok tokenizacji oraz normalizacji tekstu, przeanalizują części mowy i struktury składniowe, a także zastosują rozpoznawanie nazw własnych, analizę sentymentu i klasyczne modele klasyfikacji. Program obejmuje kontrolę jakości danych, podział zbioru, dobór metryk, analizę błędów, reprodukowalność eksperymentów oraz ocenę ograniczeń wynikających z języka, domeny i stronniczości danych.
Dla kogo jest szkolenie NLTK?
Programistów i inżynierów danych, którzy chcą tworzyć potoki przygotowania, analizy i klasyfikacji danych tekstowych w Pythonie
Data scientistów i analityków danych, którzy pracują z dokumentami, opiniami, wiadomościami, zgłoszeniami lub innymi nieustrukturyzowanymi zbiorami tekstowymi
Specjalistów IT, którzy chcą poznać klasyczne techniki NLP i wykorzystać NLTK do prototypowania oraz automatyzacji powtarzalnych operacji na tekście
Wymagane umiejętności technologiczne:
Znajomość Pythona obejmująca funkcje, kolekcje, instrukcje warunkowe, pętle, import modułów oraz odczyt danych z plików
Podstawowa znajomość przetwarzania danych, w tym czyszczenia zbiorów, podziału danych na próbki oraz interpretacji prostych statystyk
Umiejętność pracy ze środowiskiem wirtualnym, menedżerem pakietów pip oraz notebookiem Jupyter lub wybranym IDE
Czego nauczysz się na szkoleniu NLTK?
- Skonfigurujesz NLTK i wymagane zasoby językowe oraz utworzysz powtarzalny potok przetwarzania kolekcji dokumentów
- Przygotujesz tekst do analizy za pomocą tokenizacji, normalizacji, usuwania słów funkcyjnych, stemmingu lub lematyzacji i porównasz wpływ tych operacji na wyniki
- Przeanalizujesz części mowy, struktury składniowe, encje i sentyment oraz rozpoznasz ograniczenia metod zależnych od języka, domeny i jakości danych
- Zbudujesz i ocenisz klasyfikator tekstu, przygotujesz cechy, rozdzielisz dane treningowe i testowe, obliczysz metryki jakości oraz przeanalizujesz macierz pomyłek
Program szkolenia
Dzień 1: Podstawy NLP i środowisko NLTK
Moduł 1: Podstawy przetwarzania języka naturalnego (NLP)
- Wprowadzenie do NLP: dane tekstowe, reprezentacja dokumentów, ekstrakcja informacji, klasyfikacja tekstu, analiza opinii oraz ograniczenia automatycznej interpretacji języka
- Przegląd narzędzi i technik NLP: metody regułowe, klasyczne modele statystyczne, zasoby leksykalne, potoki przetwarzania oraz kryteria doboru rozwiązania
Moduł 2: Wprowadzenie do NLTK
- Środowisko NLTK: instalacja pakietu, konfiguracja środowiska wirtualnego, repozytorium nltk_data, pobieranie zasobów oraz weryfikacja dostępności korpusów i modeli
- Architektura NLTK: moduły tokenizacji, korpusów, stemmingu, lematyzacji, tagowania, parsowania, klasyfikacji, sentymentu oraz metryk jakości
Moduł 3: Podstawowe operacje w NLTK
- Tokenizacja tekstu: tokeny słowne, segmentacja zdań, wyrażenia regularne, znaki interpunkcyjne, wyjątki językowe oraz kontrola granic segmentów
- Normalizacja tekstu: wielkość liter, słowa funkcyjne, znaki specjalne, stemming, lematyzacja z WordNet oraz wpływ redukcji tekstu na zachowanie informacji
Moduł 4: Analiza tekstu za pomocą NLTK
- Potok operacji tekstowych: wczytywanie dokumentów, czyszczenie danych, tokenizacja, normalizacja, ekstrakcja cech, przetwarzanie wsadowe oraz zapis wyników
- Analiza zbiorów tekstowych: rozkłady częstości, konkordancje, kolokacje, n-gramy, braki danych, anomalie, jakość próbek oraz podstawowa analiza błędów
Dzień 2: Analiza językowa, sentyment i klasyfikacja tekstu
Moduł 5: Analiza składniowa i semantyczna
- Części mowy i analiza składniowa: tagowanie POS, zestawy znaczników, gramatyki bezkontekstowe, chunking, drzewa składniowe oraz zależność wyników od języka i domeny
- Zależności i drzewa składniowe: grafy zależności, parsery regułowe i statystyczne, reprezentacja struktur, wizualizacja wyników oraz walidacja na przykładach testowych
Moduł 6: Rozpoznawanie nazw własnych (NER) i analiza sentymentu
- Rozpoznawanie nazw własnych: tagowanie sekwencji, chunking encji, kategorie nazw, ekstrakcja jednostek, precyzja, kompletność oraz analiza fałszywych wskazań
- Analiza sentymentu: VADER, podejście leksykalne, klasyfikacja opinii, negacja, intensyfikatory, progi interpretacyjne, błędy domenowe oraz ryzyko stronniczości językowej
Moduł 7: Modele NLP z użyciem NLTK
- Klasyfikacja tekstu: reprezentacja cech, klasyfikator naiwny Bayesa, zbiory treningowy i testowy, dokładność, precyzja, kompletność, F1, macierz pomyłek oraz analiza błędów
- Korpusy i eksperymenty NLP: zasoby NLTK, licencje i pochodzenie danych, reprezentatywność próbek, równowaga klas, ziarno losowości, wersjonowanie konfiguracji oraz podstawy monitorowania jakości