ai-digest.dev
last updated 4 h ago
TrainingarXiv cs.AI 34 d ago

TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment

The article presents Trajectory Matching Policy Optimization (TMPO), a novel approach to align diffusion models with downstream tasks, addressing issues of reward hacking and mode collapse in reinforcement learning. TMPO replaces traditional scalar reward maximization with a Softmax Trajectory Balance objective, enabling trajectory-level reward distribution matching to enhance generative diversity by 9.1% compared to existing methods. Additionally, it employs Dynamic Stochastic Tree Sampling to optimize training efficiency by reducing redundant computations, making it a significant advancement for practitioners seeking to improve generative model performance and diversity.

reinforcement-learningdiffusion-modelspolicy-optimizationrelevance 0.00 · engagement 0.00
Read at source ↗← all news