Tema

I concettimachine-learningNel grafo

Cache di chiavi e valori

La memoria che il motore riempie durante la generazione con le chiavi e i valori già calcolati, per non ricalcolarli: possibile perché il passato è fisso; nell'addestramento non esiste

Si lega a

riusa i pesi di attenzione e le proiezioni del pezzo sull'attenzione; cresce con la finestra di contesto; è ridotta dalle attenzioni raggruppate

Da qui ci si arriva

  1. Motore di inferenza

    Il software che carica i pesi di un modello e li esegue per produrre le risposte: gestisce la cache, il campionamento e le richieste

  2. Attenzioni raggruppate

    La famiglia di soluzioni nei pesi che comprime la cache di chiavi e valori: la GQA condivide chiavi e valori fra gruppi di teste, la MLA li comprime in un vettore latente; il motore può aggiungere la quantizzazione della cache al volo

Dove se ne parla

  1. Le evoluzioni: MoE e cache di chiavi e valori