Si lega a
modifica il blocco del Transformer; usa l'instradamento; distingue parametri totali da parametri attivi
Da qui ci si arriva
- Quantizzazione
La compressione dei pesi da sedici bit a otto o quattro: il modello occupa meno memoria e arriva più in fretta, a scapito di un po' di precisione
- Streaming dei pesi
La lettura dei pesi dal disco al bisogno invece di caricarli tutti in memoria: con mmap, col caricamento pigro degli esperti del MoE, o con la cache dei neuroni attivi
- Sparsità delle attivazioni
La regolarità per cui una piccola frazione di neuroni è attiva su quasi tutti i token, mentre la maggior parte si attiva di rado: è ciò che rende indovinabile lo streaming
- Scheda del modello
Il documento che accompagna un modello: dichiara famiglia, taglia, parametri attivi, finestra di contesto, tokenizzatore e licenza - e a volte tace sull'architettura
- Modello denso
Il modello che attiva tutti i suoi parametri a ogni token, in addestramento e in generazione: il costo per token è proporzionale alla taglia