Fabrice Harel-Canada
Fabrice Harel-Canada
Home
Publications
Experience
Projects
CV
Light
Dark
Automatic
dpo
VaPR -- Vision-language Preference alignment for Reasoning
Preference finetuning methods like Direct Preference Optimization (DPO) with AI-generated feedback have shown promise in aligning Large Vision-Language Models (LVLMs) with human preferences. However, existing techniques overlook the prevalence of …
Cite
×