- Základy zpracování textu
Úvod do NLP. Pattern matrching a regulární výrazy pro vyhledávání vzorů v textu. Tokenizace textu. Stemming a lemmatizace. Segmentace vět. Editační vzdálenost, měření podobnosti mezi slovy.
- Statistické jazykové modely (N-gramy)
N-gramy: unigramy, bigramy, trigramy. Výpočet pravděpodobností sekvencí. Perplexita.
- Klasifikace textu – Naive Bayes
Princip Naive Bayes klasifikátoru. Trénování modelu na datech. Metriky pro evaluaci: Precision, Recall, F1-skóre. Ukázky: analýza sentimentu, detekce spamu.
- Klasifikace textu – Logistická regrese
Lineární a logistická regrese. Reprezentace textu pomocí příznaků (features). Výpočet vah pomocí gradientního sestupu. Prevence přeučení. Multinomická logistická regrese.
- Vektorový model a Word Embeddings
Tradiční vektorový model: TF-IDF. Word Embeddings: Word2vec, Skip-gram, Continuous bag of words. Vlastnosti embeddings. Zkreslení (bias) v datech a modelech.
- Úvod do neuronových sítí pro NLP
Perceptron. Dopředné neuronové sítě. Aktivacní funkce (ReLU, sigmoid). Trénování sítí. Využití pro klasifikaci textu.
- Rekurentní neuronové sítě (RNN a LSTM)
Princip rekurentních neuronových sítí (RNN) a jejich vnitřní stav (paměť). Problém mizejících a explodujících gradientů. LSTM (Long Short-Term Memory) a GRU buňky. Obousměrná a vrstvěná architektura RNN.
- Model Encoder-Decoder a mechanismus Attention
Architektura Encoder-Decoder. Mechanismus Attention
- Architektura Transformer
Self-Attention. Multi-Head Attention. Poziční kódování. Struktura bloku Transformeru (encoder a decoder).
- Velké jazykové modely (LLM)
GPT (Generative Pre-trained Transformer). Princip předtrénování. Generování textu a techniky vzorkování.
- Obousměrné modely BERT a Fine tuning
BERT (Bidirectional Encoder Representations from Transformers). Masked Language Modeling (MLM). Fine tuning: adaptace předtrénovaného modelu na specifické úlohy (klasifikace, rozpoznávání entit - NER).
- Budoucnost NLP
Prompting: Zero-shot, one-shot, a few-shot learning. Chain-of-Thought prompting pro komplexní úlohy. RLHF (Reinforcement Learning from Human Feedback).