Tema

I concettimachine-learningNel grafo

Blocco del Transformer

L'unità che si ripete lungo la pila: una normalizzazione, l'attenzione multi-testa, una connessione residua, poi una seconda normalizzazione, l'MLP e una seconda connessione residua

Si lega a

compone il meccanismo di attenzione e l'MLP del Transformer; la sua pila è il corpo del modello di linguaggio

Da qui ci si arriva

  1. Motore di inferenza

    Il software che carica i pesi di un modello e li esegue per produrre le risposte: gestisce la cache, il campionamento e le richieste

  2. Connessione residua

    La somma dell'ingresso di un sotto-blocco con la sua uscita: il segnale e il gradiente hanno una scorciatoia, e ogni blocco corregge invece di riscrivere

  3. MLP del Transformer

    Lo strato che allarga ogni vettore di quattro volte, lo passa per una curva morbida e lo riporta alla dimensione di partenza, elaborando ogni posizione da sola

  4. Encoder-only

    La forma del Transformer che legge senza generare: trasforma la sequenza in rappresentazioni; la forma di BERT

  5. Modello denso

    Il modello che attiva tutti i suoi parametri a ogni token, in addestramento e in generazione: il costo per token è proporzionale alla taglia

  6. Miscela di esperti

    L'architettura che sostituisce l'MLP del blocco con una schiera di esperti e un router: i parametri totali crescono, il calcolo per token usa solo gli esperti scelti

Dove se ne parla

  1. Il Transformer, aperto col cacciavite