Si lega a
è favorito dalla miscela di esperti (pochi parametri attivi per token); è limitato dalla banda del disco; lo usano llama.cpp, MLX e DwarfStar
Da qui ci si arriva
- Quantizzazione
La compressione dei pesi da sedici bit a otto o quattro: il modello occupa meno memoria e arriva più in fretta, a scapito di un po' di precisione
- Memoria unificata
La memoria condivisa fra processore e scheda grafica, come nei chip Apple: un modello può usare tutta la memoria della macchina
- Sparsità delle attivazioni
La regolarità per cui una piccola frazione di neuroni è attiva su quasi tutti i token, mentre la maggior parte si attiva di rado: è ciò che rende indovinabile lo streaming