Si lega a
è un caso di apprendimento per rinforzo; produce i modelli di ragionamento; richiama la macchina-bambina di Turing
Da qui ci si arriva
- Rinforzo da preferenze umane
Il rinforzo la cui ricompensa è un gusto: classifiche umane, un modello di ricompensa, e l'addestramento a produrre risposte preferite
- Modelli di ragionamento
I modelli che pensano a lungo prima di rispondere, con catene di ragionamento interne, addestrati con ricompense verificabili