Direct Preference Optimization
Verificato
Aggiornato il 14/08/2026
Significato di «Direct Preference Optimization»
Direct Preference Optimization (DPO): metodo di allineamento che ottimizza direttamente un modello linguistico sulle preferenze umane, a partire da coppie di risposte preferita e rifiutata, senza addestrare un modello di ricompensa separato né usare reinforcement learning come nell'RLHF.
Fonti: Rafailov et al. 2023, Direct Preference Optimization (arXiv:2305.18290); Hugging Face TRL, DPOTrainer docs. Verifica web 2026-08-03. · Verificato il 2026-08-03
Domande frequenti su Direct Preference Optimization
Cosa significa «Direct Preference Optimization»?
Direct Preference Optimization (DPO): metodo di allineamento che ottimizza direttamente un modello linguistico sulle preferenze umane, a partire da coppie di risposte preferita e rifiutata, senza addestrare un modello di ricompensa separato né usare reinforcement learning come nell'RLHF.
A quale glossario appartiene «Direct Preference Optimization»?
«Direct Preference Optimization» fa parte del glossario NLP e LLM, nella categoria Intelligenza Artificiale di Glossario Italiano.