Szkolenie Natural Language Toolkit (NLTK)

Poziom

Średniozaawansowany

Czas

16h / 2 dni

Termin

Indywidualnie

Cena

Indywidualnie

Szkolenie Natural Language Toolkit

Szkolenie z NLTK to dwudniowy, praktyczny kurs poświęcony analizie i przetwarzaniu tekstu w Pythonie. Uczestnicy przygotują środowisko i zasoby językowe, zbudują potok tokenizacji oraz normalizacji tekstu, przeanalizują części mowy i struktury składniowe, a także zastosują rozpoznawanie nazw własnych, analizę sentymentu i klasyczne modele klasyfikacji. Program obejmuje kontrolę jakości danych, podział zbioru, dobór metryk, analizę błędów, reprodukowalność eksperymentów oraz ocenę ograniczeń wynikających z języka, domeny i stronniczości danych.

Dla kogo jest szkolenie NLTK?
  • logo infoshare Programistów i inżynierów danych, którzy chcą tworzyć potoki przygotowania, analizy i klasyfikacji danych tekstowych w Pythonie
  • logo infoshare Data scientistów i analityków danych, którzy pracują z dokumentami, opiniami, wiadomościami, zgłoszeniami lub innymi nieustrukturyzowanymi zbiorami tekstowymi
  • logo infoshare Specjalistów IT, którzy chcą poznać klasyczne techniki NLP i wykorzystać NLTK do prototypowania oraz automatyzacji powtarzalnych operacji na tekście
Wymagane umiejętności technologiczne:
  • logo infoshare Znajomość Pythona obejmująca funkcje, kolekcje, instrukcje warunkowe, pętle, import modułów oraz odczyt danych z plików
  • logo infoshare Podstawowa znajomość przetwarzania danych, w tym czyszczenia zbiorów, podziału danych na próbki oraz interpretacji prostych statystyk
  • logo infoshare Umiejętność pracy ze środowiskiem wirtualnym, menedżerem pakietów pip oraz notebookiem Jupyter lub wybranym IDE

Czego nauczysz się na szkoleniu NLTK?

  • Skonfigurujesz NLTK i wymagane zasoby językowe oraz utworzysz powtarzalny potok przetwarzania kolekcji dokumentów
  • Przygotujesz tekst do analizy za pomocą tokenizacji, normalizacji, usuwania słów funkcyjnych, stemmingu lub lematyzacji i porównasz wpływ tych operacji na wyniki
  • Przeanalizujesz części mowy, struktury składniowe, encje i sentyment oraz rozpoznasz ograniczenia metod zależnych od języka, domeny i jakości danych
  • Zbudujesz i ocenisz klasyfikator tekstu, przygotujesz cechy, rozdzielisz dane treningowe i testowe, obliczysz metryki jakości oraz przeanalizujesz macierz pomyłek

Program szkolenia

Dzień 1: Podstawy NLP i środowisko NLTK

 

Moduł 1: Podstawy przetwarzania języka naturalnego (NLP)

  • Wprowadzenie do NLP: dane tekstowe, reprezentacja dokumentów, ekstrakcja informacji, klasyfikacja tekstu, analiza opinii oraz ograniczenia automatycznej interpretacji języka
  • Przegląd narzędzi i technik NLP: metody regułowe, klasyczne modele statystyczne, zasoby leksykalne, potoki przetwarzania oraz kryteria doboru rozwiązania

Moduł 2: Wprowadzenie do NLTK

  • Środowisko NLTK: instalacja pakietu, konfiguracja środowiska wirtualnego, repozytorium nltk_data, pobieranie zasobów oraz weryfikacja dostępności korpusów i modeli
  • Architektura NLTK: moduły tokenizacji, korpusów, stemmingu, lematyzacji, tagowania, parsowania, klasyfikacji, sentymentu oraz metryk jakości

Moduł 3: Podstawowe operacje w NLTK

  • Tokenizacja tekstu: tokeny słowne, segmentacja zdań, wyrażenia regularne, znaki interpunkcyjne, wyjątki językowe oraz kontrola granic segmentów
  • Normalizacja tekstu: wielkość liter, słowa funkcyjne, znaki specjalne, stemming, lematyzacja z WordNet oraz wpływ redukcji tekstu na zachowanie informacji

Moduł 4: Analiza tekstu za pomocą NLTK

  • Potok operacji tekstowych: wczytywanie dokumentów, czyszczenie danych, tokenizacja, normalizacja, ekstrakcja cech, przetwarzanie wsadowe oraz zapis wyników
  • Analiza zbiorów tekstowych: rozkłady częstości, konkordancje, kolokacje, n-gramy, braki danych, anomalie, jakość próbek oraz podstawowa analiza błędów

 

Dzień 2: Analiza językowa, sentyment i klasyfikacja tekstu

 

Moduł 5: Analiza składniowa i semantyczna

  • Części mowy i analiza składniowa: tagowanie POS, zestawy znaczników, gramatyki bezkontekstowe, chunking, drzewa składniowe oraz zależność wyników od języka i domeny
  • Zależności i drzewa składniowe: grafy zależności, parsery regułowe i statystyczne, reprezentacja struktur, wizualizacja wyników oraz walidacja na przykładach testowych

Moduł 6: Rozpoznawanie nazw własnych (NER) i analiza sentymentu

  • Rozpoznawanie nazw własnych: tagowanie sekwencji, chunking encji, kategorie nazw, ekstrakcja jednostek, precyzja, kompletność oraz analiza fałszywych wskazań
  • Analiza sentymentu: VADER, podejście leksykalne, klasyfikacja opinii, negacja, intensyfikatory, progi interpretacyjne, błędy domenowe oraz ryzyko stronniczości językowej

Moduł 7: Modele NLP z użyciem NLTK

  • Klasyfikacja tekstu: reprezentacja cech, klasyfikator naiwny Bayesa, zbiory treningowy i testowy, dokładność, precyzja, kompletność, F1, macierz pomyłek oraz analiza błędów
  • Korpusy i eksperymenty NLP: zasoby NLTK, licencje i pochodzenie danych, reprezentatywność próbek, równowaga klas, ziarno losowości, wersjonowanie konfiguracji oraz podstawy monitorowania jakości

Skontaktuj sie z nami

zorganizujemy dla Ciebie szkolenie dopasowane do Twoich potrzeb

Przemysław Wołosz

Key Account Manager

przemyslaw.wolosz@infoShareAcademy.com

    Administratorem danych osobowych jest InfoShare Academy Sp. z o.o. z siedzibą w Gdańsku, al. Grunwaldzka 427B, 80-309 Gdańsk, KRS: 0000531749, NIP: 5842742213. Dane osobowe przetwarzane są zgodnie z klauzulą informacyjną.