围绕多模态信息的统一表征、可控生成与动态环境建模,重点开展以下研究:
1) 可控图像生成与编辑:研究文本、图像、布局、姿态等多条件驱动的图像生成与编辑方法,实现生成内容在语义、结构、风格和局部细节层面的精准控制。
2) 专业领域图像生成:面向医疗、遥感、工业、科学计算等专业领域,研究融合领域知识与少样本学习的高质量图像生成方法,提升模型在专业场景中的真实性、准确性与泛化能力。
3) 世界模型:研究面向复杂动态环境的多模态世界建模方法,学习环境状态、物理规律和时空演化机制,支持未来场景预测、交互推演与智能决策。
