Si lega a
compone il meccanismo di attenzione e l'MLP del Transformer; la sua pila è il corpo del modello di linguaggio
Da qui ci si arriva
- Motore di inferenza
Il software che carica i pesi di un modello e li esegue per produrre le risposte: gestisce la cache, il campionamento e le richieste
- Connessione residua
La somma dell'ingresso di un sotto-blocco con la sua uscita: il segnale e il gradiente hanno una scorciatoia, e ogni blocco corregge invece di riscrivere
- MLP del Transformer
Lo strato che allarga ogni vettore di quattro volte, lo passa per una curva morbida e lo riporta alla dimensione di partenza, elaborando ogni posizione da sola
- Encoder-only
La forma del Transformer che legge senza generare: trasforma la sequenza in rappresentazioni; la forma di BERT
- Modello denso
Il modello che attiva tutti i suoi parametri a ogni token, in addestramento e in generazione: il costo per token è proporzionale alla taglia
- Miscela di esperti
L'architettura che sostituisce l'MLP del blocco con una schiera di esperti e un router: i parametri totali crescono, il calcolo per token usa solo gli esperti scelti