ai-digest.dev
last updated 4 h ago
TrainingarXiv cs.AI 34 d ago

Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL

The Chain-of-Goals Hierarchical Policy (CoGHP) introduces a unified autoregressive framework for long-horizon offline goal-conditioned reinforcement learning, overcoming limitations of existing hierarchical methods that use separate networks and single subgoals. CoGHP employs an MLP-Mixer backbone to facilitate cross-token communication, generating a sequence of latent subgoals that condition subsequent actions. This approach has shown consistent performance improvements over strong offline baselines in navigation and manipulation tasks, making it a significant advancement for practitioners focusing on long-horizon decision-making in RL.

reinforcement-learningpolicyhierarchicalrelevance 0.00 · engagement 0.00
Read at source ↗← all news