Si lega a
addestra la rete neurale multistrato; usa la discesa del gradiente; è l'erede della regola di apprendimento del percettrone; soffre del gradiente che svanisce
Da qui ci si arriva
- Matrice degli embedding
Un parametro appreso con una riga per ogni token e una colonna per ogni dimensione del vettore
- Preaddestramento
La prima fase: predire il prossimo token su un corpus enorme; il modello impara il sapere ma continua il testo invece di rispondere
- Rete neurale multistrato
Neuroni artificiali disposti in strati, ognuno dei quali legge le uscite del precedente: con almeno uno strato nascosto e curve non lineari supera il limite della retta del percettrone
- Strato nascosto
Lo strato fra ingresso e uscita, che nessuna etichetta raggiunge direttamente: trasforma i dati finché il problema diventa separabile
- Discesa del gradiente
Correggere ogni peso spostandolo di un passo nella direzione che riduce l'errore, come scendere un pendio seguendo la pendenza del punto in cui ci si trova
- Gradiente che svanisce
Negli strati profondi il segnale d'errore si spegne, perché torna indietro moltiplicato per pendenze minori di 1 a ogni strato: gli strati vicini all'ingresso smettono di imparare