Poziom

Średniozaawansowany

Czas

16h / 2 dni

Termin

Indywidualnie

Cena

Indywidualnie

Szkolenie SpaCy

Szkolenie ze spaCy to dwudniowy, praktyczny kurs poświęcony analizie i przetwarzaniu tekstu w Pythonie. Uczestnicy skonfigurują środowisko, wykorzystają gotowe potoki językowe oraz przeanalizują tokeny, zdania, formy gramatyczne, zależności składniowe i encje. Następnie przygotują prototyp klasyfikatora tekstu, obejmujący dane treningowe, konfigurację eksperymentu, walidację i ocenę jakości. Około 80% czasu zajmują ćwiczenia prowadzące do powstania notebooka analitycznego i eksperymentalnego modelu NLP.

Dla kogo jest szkolenie SpaCy?
  • logo infoshare Programiści Python i inżynierowie danych zainteresowani tworzeniem potoków przetwarzania tekstu oraz integracją komponentów NLP z aplikacjami
  • logo infoshare Data scientiści i analitycy danych przygotowujący dane tekstowe, ekstrakcję informacji, klasyfikację dokumentów lub analizę opinii
  • logo infoshare Specjaliści IT automatyzujący przetwarzanie wiadomości, zgłoszeń, dokumentów, opisów produktów i innych nieustrukturyzowanych danych tekstowych
Wymagane umiejętności technologiczne:
  • logo infoshare Znajomość Pythona obejmująca funkcje, kolekcje, instrukcje warunkowe, pętle, import modułów oraz odczyt danych z plików
  • logo infoshare Umiejętność pracy ze środowiskiem wirtualnym, menedżerem pakietów pip oraz notebookiem Jupyter lub wybranym IDE
  • logo infoshare Podstawowa znajomość przetwarzania danych tabelarycznych oraz pojęć zbioru treningowego, walidacyjnego, etykiety i metryki jakości

Czego nauczysz się na szkoleniu SpaCy?

  • Skonfigurujesz środowisko spaCy, dobierzesz potok językowy i utworzysz program przetwarzający kolekcję dokumentów tekstowych
  • Wyodrębnisz tokeny, zdania, lematy, cechy morfologiczne, części mowy, zależności składniowe oraz encje i zapiszesz wyniki w ustrukturyzowanej formie
  • Połączysz komponenty statystyczne z regułami, przeanalizujesz typowe błędy oraz ocenisz wpływ jakości danych, języka i domeny na wyniki
  • Przygotujesz i ocenisz prototyp klasyfikatora tekstu, w tym klasyfikatora sentymentu, z użyciem podziału danych, konfiguracji treningu i właściwych metryk

Program szkolenia

Dzień 1: Podstawy NLP i środowisko spaCy

 

Moduł 1: Podstawy przetwarzania języka naturalnego (NLP)

  • Wprowadzenie do NLP: reprezentacja tekstu, ekstrakcja informacji, klasyfikacja dokumentów, analiza opinii oraz granice automatycznej interpretacji języka
  • Przegląd narzędzi i technik NLP: metody regułowe, modele statystyczne, potoki językowe, modele transformerowe oraz kryteria doboru rozwiązania

Moduł 2: Wprowadzenie do spaCy

  • Instalacja i konfiguracja spaCy: środowisko wirtualne, pakiety językowe, zależności, obsługa CPU i GPU oraz weryfikacja konfiguracji
  • Przegląd architektury spaCy: obiekty Language, Doc, Span i Token, słownik współdzielony oraz kolejność komponentów potoku

Moduł 3: Podstawowe operacje w spaCy

  • Tokenizacja i segmentacja zdań: reguły podziału tekstu, wyjątki językowe, znaki specjalne oraz kontrola granic tokenów i zdań
  • Lematyzacja i stop words: formy podstawowe wyrazów, listy słów funkcyjnych, konfiguracja językowa oraz ograniczenia automatycznego usuwania tokenów
  • Analiza morfologiczna: części mowy, cechy fleksyjne, właściwości tokenów oraz interpretacja adnotacji językowych

Moduł 4: Analiza tekstu za pomocą spaCy

  • Implementacja potoku analitycznego: przetwarzanie pojedynczych dokumentów i kolekcji tekstów, komponenty aktywne, przetwarzanie wsadowe oraz zapis wyników
  • Analiza zbiorów danych tekstowych: normalizacja wejścia, statystyki dokumentów, kontrola braków i anomalii oraz jakościowa analiza błędów

 

Dzień 2: Analiza językowa, encje i modele klasyfikacyjne

 

Moduł 5: Analiza składniowa i semantyczna

  • Części mowy i analiza składniowa: znaczniki POS, cechy morfologiczne, struktura zdania oraz zależność wyników od języka i domeny tekstu
  • Zależności i drzewa składniowe: relacje między tokenami, korzenie zdań, wizualizacja struktur oraz walidacja wyników na przykładach domenowych

Moduł 6: Rozpoznawanie nazw własnych (NER) i klasyfikacja sentymentu

  • Rozpoznawanie nazw własnych: gotowy komponent NER, typy encji, reguły EntityRuler, konflikty dopasowań oraz ocena precyzji i kompletności
  • Klasyfikacja sentymentu: komponenty textcat i textcat_multilabel, etykiety klas, progi decyzyjne, metryki jakości, błędy domenowe oraz ryzyko stronniczości danych

Moduł 7: Modele NLP z użyciem spaCy

  • Model klasyfikacji tekstu: format danych, zbiory treningowy i walidacyjny, konfiguracja komponentu, proces treningu, strojenie podstawowych parametrów oraz analiza pomyłek
  • Korpusy i konfiguracja eksperymentu: jakość adnotacji, reprezentatywność próbek, plik konfiguracyjny, ziarno losowości, metryki, wersjonowanie artefaktów oraz podstawy monitorowania jakości modelu

Skontaktuj sie z nami

zorganizujemy dla Ciebie szkolenie dopasowane do Twoich potrzeb

Przemysław Wołosz

Key Account Manager

przemyslaw.wolosz@infoShareAcademy.com

    Administratorem danych osobowych jest InfoShare Academy Sp. z o.o. z siedzibą w Gdańsku, al. Grunwaldzka 427B, 80-309 Gdańsk, KRS: 0000531749, NIP: 5842742213. Dane osobowe przetwarzane są zgodnie z klauzulą informacyjną.