Tema

I concettimachine-learningNel grafo

Parallelismo tensoriale

La spartizione del modello per fette di matrice: ogni macchina tiene una parte di ogni strato e scambia le somme parziali a ogni passaggio; richiede un'interconnessione velocissima

Si lega a

è un modo di eseguire il motore di inferenza su più macchine; richiede l'all-reduce fra le macchine

Da qui ci si arriva

  1. Parallelismo per livelli

    La spartizione del modello fra più computer per gruppi di strati: le attivazioni attraversano la rete da uno stadio all'altro a ogni token; somma la capacità delle macchine

Dove se ne parla

  1. I motori che eseguono i pesi: da llama.cpp allo streaming dal disco