Tema

I concettimachine-learningNel grafo

Modelli di ragionamento

I modelli che pensano a lungo prima di rispondere, con catene di ragionamento interne, addestrati con ricompense verificabili

Si lega a

derivano dal rinforzo con ricompense verificabili; la loro capacità è al centro del dibattito sull'emergenza

Da qui ci si arriva

  1. Costo per token

    Quanto si paga per ogni token di ingresso, di ragionamento e di uscita: dipende dalla lingua attraverso il tokenizzatore, dalla finestra di contesto, dai parametri attivi e dai token di ragionamento

  2. Rinforzo con ricompense verificabili

    Il rinforzo la cui ricompensa è un fatto: la risposta giusta, il test che passa; da qui emergono i modelli di ragionamento

Dove se ne parla

  1. L'addestramento che fa la differenza: dal rinforzo al ragionamento