Si lega a
è un modo dell'apprendimento automatico; la serie lo riprenderà per i modelli di ragionamento
Da qui ci si arriva
- Rinforzo da preferenze umane
Il rinforzo la cui ricompensa è un gusto: classifiche umane, un modello di ricompensa, e l'addestramento a produrre risposte preferite
- Rinforzo con ricompense verificabili
Il rinforzo la cui ricompensa è un fatto: la risposta giusta, il test che passa; da qui emergono i modelli di ragionamento
- Apprendimento automatico
Far ricavare le regole alla macchina dagli esempi, invece di scrivergliele: nelle parole di Samuel (1959), programmare un calcolatore perché si comporti in un modo che chiameremmo apprendimento, eliminando gran parte della programmazione minuziosa