Si lega a
deriva dalla rappresentazione iniziale e dagli strati successivi; in nanoGPT la rappresentazione iniziale somma l'embedding del token all'embedding posizionale
Da qui ci si arriva
- Embedding di parola
Il vettore statico associato a una parola intera nei modelli storici come word2vec
- Autoattenzione
Il meccanismo di attenzione applicato da una sequenza verso sé stessa: ogni posizione interroga le altre posizioni della stessa sequenza
- Decoder-only
La forma del Transformer che genera: legge la sequenza e produce il prossimo token con la maschera causale; la forma di GPT, Claude, DeepSeek, Qwen e GLM