Multimodal
Hierarchical Concept-to-Appearance Guidance for Multi-Subject Image Generation
The paper introduces Hierarchical Concept-to-Appearance Guidance (CAG) for multi-subject image generation, addressing identity inconsistency and compositional control in existing diffusion models. The framework employs a VAE dropout training strategy to enhance semantic signal reliance and integrates a correspondence-aware masked attention module within the Diffusion Transformer (DiT) to ensure precise attribute binding. This approach achieves state-of-the-art results in multi-subject image generation, improving prompt adherence and subject consistency, which is crucial for practitioners aiming to enhance image synthesis quality in AI applications.
image-generationguidancemulti-subject