Přeskočit na hlavní obsah
Přeskočit hlavičku

Zpracování přirozeného jazyka

Typ studia navazující magisterské
Jazyk výuky čeština
Kód 460-4168/01
Zkratka ZPJ
Název předmětu česky Zpracování přirozeného jazyka
Název předmětu anglicky Natural Language Processing
Kreditů 5
Garantující katedra Katedra informatiky
Garant předmětu doc. Mgr. Jiří Dvorský, Ph.D.

Subject syllabus

- Základy zpracování textu
Úvod do NLP. Pattern matrching a regulární výrazy pro vyhledávání vzorů v textu. Tokenizace textu. Stemming a lemmatizace. Segmentace vět. Editační vzdálenost, měření podobnosti mezi slovy.

- Statistické jazykové modely (N-gramy)
N-gramy: unigramy, bigramy, trigramy. Výpočet pravděpodobností sekvencí. Perplexita.

- Klasifikace textu – Naive Bayes
Princip Naive Bayes klasifikátoru. Trénování modelu na datech. Metriky pro evaluaci: Precision, Recall, F1-skóre. Ukázky: analýza sentimentu, detekce spamu.

- Klasifikace textu – Logistická regrese
Lineární a logistická regrese. Reprezentace textu pomocí příznaků (features). Výpočet vah pomocí gradientního sestupu. Prevence přeučení. Multinomická logistická regrese.

- Vektorový model a Word Embeddings
Tradiční vektorový model: TF-IDF. Word Embeddings: Word2vec, Skip-gram, Continuous bag of words. Vlastnosti embeddings. Zkreslení (bias) v datech a modelech.

- Úvod do neuronových sítí pro NLP
Perceptron. Dopředné neuronové sítě. Aktivacní funkce (ReLU, sigmoid). Trénování sítí. Využití pro klasifikaci textu.

- Rekurentní neuronové sítě (RNN a LSTM)
Princip rekurentních neuronových sítí (RNN) a jejich vnitřní stav (paměť). Problém mizejících a explodujících gradientů. LSTM (Long Short-Term Memory) a GRU buňky. Obousměrná a vrstvěná architektura RNN.

- Model Encoder-Decoder a mechanismus Attention
Architektura Encoder-Decoder. Mechanismus Attention

- Architektura Transformer
Self-Attention. Multi-Head Attention. Poziční kódování. Struktura bloku Transformeru (encoder a decoder).

- Velké jazykové modely (LLM)
GPT (Generative Pre-trained Transformer). Princip předtrénování. Generování textu a techniky vzorkování.

- Obousměrné modely BERT a Fine tuning
BERT (Bidirectional Encoder Representations from Transformers). Masked Language Modeling (MLM). Fine tuning: adaptace předtrénovaného modelu na specifické úlohy (klasifikace, rozpoznávání entit - NER).

- Budoucnost NLP
Prompting: Zero-shot, one-shot, a few-shot learning. Chain-of-Thought prompting pro komplexní úlohy. RLHF (Reinforcement Learning from Human Feedback).

Literature

1. Jurafsky, Dan, and James H. Martin. Speech and Language Processing. 3rd ed. draft, Stanford University, 2025, web.stanford.edu/~jurafsky/slp3/. Accessed 30 Aug. 2025.
2. Tunstall, Lewis, et al. Natural Language Processing with Transformers. O'Reilly Media, 2022.
3. Manning, Christopher D., and Hinrich Schütze. Foundations of Statistical Natural Language Processing. MIT Press, 1999.
4. Goodfellow, Ian, et al. Deep Learning. MIT Press, 2016.

Advised literature

1. Kopecký M., Pokorný J.: Dokumentografické informační systémy, Karolinum 2006, ISBN 8024611481
2. Manning, C. D.; Raghavan, P. & Schutze, H.: Introduction to Information Retrieval, Cambridge University Press, 2008. Dostupné z https://nlp.stanford.edu/IR-book/
3. Witten I. H., Moffat A., Bell T. C.: Managing Gigabytes (2nd ed.): Compressing and Indexing Documents and Images, Morgan Kaufmann Publishers Inc., 1999, ISBN 1-55860-570-3