Training
Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL
The Chain-of-Goals Hierarchical Policy (CoGHP) introduces a unified autoregressive framework for long-horizon offline goal-conditioned reinforcement learning, overcoming limitations of existing hierarchical methods that use separate networks and single subgoals. CoGHP employs an MLP-Mixer backbone to facilitate cross-token communication, generating a sequence of latent subgoals that condition subsequent actions. This approach has shown consistent performance improvements over strong offline baselines in navigation and manipulation tasks, making it a significant advancement for practitioners focusing on long-horizon decision-making in RL.
reinforcement-learningpolicyhierarchical