Si lega a
esegue l'architettura del blocco del Transformer; gestisce la cache di chiavi e valori; è il livello distinto dall'addestramento del bilancio delle evoluzioni
Da qui ci si arriva
- Modi di acquisto di un modello
Le tre forme in cui un modello di linguaggio si compra: a servizio pagando a token, come modello privato su macchine a noleggio pagando a ore, o su macchine proprie come investimento; ogni forma sposta il punto dove i costi colpiscono
- Memoria unificata
La memoria condivisa fra processore e scheda grafica, come nei chip Apple: un modello può usare tutta la memoria della macchina
- Parallelismo per livelli
La spartizione del modello fra più computer per gruppi di strati: le attivazioni attraversano la rete da uno stadio all'altro a ogni token; somma la capacità delle macchine
- Parallelismo tensoriale
La spartizione del modello per fette di matrice: ogni macchina tiene una parte di ogni strato e scambia le somme parziali a ogni passaggio; richiede un'interconnessione velocissima