合肥工业大学计算机与信息学院院长,二级教授、博士生导师、国家杰出青年基金获得者、中组部万人计划-青年拔尖人才、江苏省杰青、江苏省双创人才。研究方向为多媒体计算、社交多媒体、计算机视觉、人工智能等。主持多项国家和省部级级项目,包括国家科技创新2030-人工智能重大专项、国家自然科学基金重点项目、江苏省重点研发计划等。荣获2018年度电子学会科学技术(自然科学类)一等奖。荣获多媒体领域的ACM汇刊TOMM 2016年度最佳论文奖(国内学者首次获得)、IEEE MM 2017年度最佳论文奖、Multimedia Modeling 2019年度最佳论文Runner Up奖。荣获ICME 2020 Outstanding Areas Chair。担任IEEE Trans. on Multimedia、IEEE Trans. on Circuits and Systems for Video Technology、ACM Trans. on Multimedia Computing, Communications and Applications、 Multimedia Systems编委。
团队Github主页:https://github.com/NJUPT-MCC
学术服务(Academic Services):
IEEE Trans. on Multimedia Associate Editor
IEEE Trans. on Circuits and Systems for Video Technology Associate Editor
ACM Trans. on Multimedia Computing, Communications and Applications Associate Editor
Multimedia Systems Associate Editor
ACM MM Area Chair
ICIG 2023 Organizing Committee Chair
MM Asia 2023 Demo Chair
MMM 2020 Publicity Chair
MMM 2019/2020 Special Session Organizer
ICMR 2020 Special Session Organizer
ACM MM Asia 2020 Special Session Chair
ACM MM Asia 2019 Publication Chair
ICME 2020 Area Chair
ICME 2019 Workshop Organizer
ICIMCS 2018 Publication Chair
承担项目(Research Projects):
1. 国家自然科学基金重点项目:面向成长型社交机器人的内容生成关键技术, 2026.01-2030.12,负责人;
2. 国家自然科学基金杰出青年项目:跨视觉-语言的互生成,2024.01-2028.12,负责人;
3. 国家重点研发计划:科技创新2030-“新一代人工智能”重大专项,认知计算基础理论与方法研究,2020.11-2023.10,负责人;
4. 国家自然科学基金重点项目:跨模态社会媒体的深度分析与决策, 2020.01-2024.12,负责人;
5. 省重点研发计划-重点项目:基于昇腾全栈技术的决策大模型与通用平台研发--决策大模型高效学习方法,2023.07-2027.06,课题负责人;
6. 国家自然科学基金面上项目:面向社会事件的跨模态知识构建、演化与推理,2019.01-2022.12,负责人;
7. 国家自然科学基金面上项目:面向旅游的地理位置互联网大数据的分析与处理,2016-2019,负责人;
8. 江苏省自然科学基金杰青项目:多媒体数据感知与分析,2021.01-2023.12,负责人;
9. 北京市自然科学基金面上项目:面向社交网络的社会事件感知、分析与处理,2015-2017,负责人;【结题入选优秀成果】
代表性论文(Selected Published Papers):
团队Github主页:https://github.com/NJUPT-MCC
[1] Tianshan Liu, DuoLa, Bing-Kun Bao*. Dual Memory-Augmented Coarse-to-Fine Prototype Learning for Detecting Errors in Egocentric Procedural Tasks. ACM Multimedia, 2026. (ACM MM'26)
[2] Yuyang Chang, Yifan Jiao, Bing-Kun Bao*. TARAM: Text-Anchor Guided Riemann Angle Matching for Replay-based Continual Learning. ACM Multimedia, 2026. (ACM MM'26)
[3] Xuancheng Xu, Gengyun Jia, Bing-Kun Bao*. Disco-LoRA: Disentangled Composition of Content, Style, and Motion for Multi-concept Video Customization. ACM Multimedia, 2026. (ACM MM'26)
[4] Tianshan Liu, Bing-Kun Bao*, Kin-Man Lam. An Episode Memory-guided Dual-stage Framework for Long-Form Video Temporal Grounding. IEEE Transactions on Image Processing, 2026. (IEEE TIP'26) [paper]
[5] Xuancheng Xu, Yaning Li, Sisi You, Bing-kun Bao. SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation. Conference on Computer Vision and Pattern Recognition, 2026. (CVPR'26) [paper] [code]
[6] Mengling Xu, Sisi You, Yaning Li, Bing-kun Bao. ProcessMaker: A Generalized Process Visualization Framework with Adaptive Sequence Steps on Diffusion Transformers. Conference on Computer Vision and Pattern Recognition, 2026. (CVPR'26) [paper] [code]
[7] Mengqi Yuan, Gengyun Jia, Bing-kun Bao*. Self-Critical Distillation Network for Video-based Commonsense Captioning. Conference on Computer Vision and Pattern Recognition, 2026. (CVPR'26) [paper]
[8] Bowen Yuan, Sisi You, Bing-kun Bao*. Predict Before You Explore: Predictive Planning with Specialized Memory for Embodied Question Answering. Conference on Computer Vision and Pattern Recognition, 2026. (CVPR'26) [paper] [code]
[9] Yiming Li, Sisi You, Bing-kun Bao*. Mixture-of-Experts based Feature Decoupling for Open Vocabulary Scene Graph Generation. Conference on Computer Vision and Pattern Recognition, 2026. (CVPR'26) [paper]
[10] Gengyun Jia, Xin Ma, Bing-Kun Bao*. Deep Orientational Representation Learning for Ordinal Regression. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026. (IEEE TPAMI'26) [paper]
[11] Tianshan Liu, Bing-Kun Bao*. Goal-guided Prompting with Adaptive Modality Selection for Efficient Assembly Activity Anticipation in Egocentric Videos. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026. (IEEE TPAMI'26) [paper]
[12] Mingjie Qiu, Zhiyi Tan, Bing-kun Bao*. Social Event Prediction via Fourier Graph Learning. Proceedings of the ACM on Web Conference, 2026. (WWW'26) [paper]
[13] Mingjie Qiu, Zhiyi Tan, Bing-kun Bao*. Towards Rare Social Event Prediction via Mediator Learning. Proceedings of the ACM on Web Conference, 2026. (WWW'26) [paper]
[14] MingCai Chen, Baoming Zhang, Zongbo Han, Wenyu Jiang, Yanmeng Wang, Shuai Feng, Yuntao Du, Bing-Kun Bao. Test-Time Selective Adaptation for Uni-Modal Distribution Shift in Multi-Modal Data. International Conference on Machine Learning, 2025. (ICML'25) [paper] [code]
[15] Bing-Kun Bao*, Yefei Sheng, Jie Wang, Yaning Li, Sisi You. InstantPainting: Expanding GANs for Efficient Text Conditioned lmage Generation Platform. AAAI Conference on Artificial Intelligence, 2025. (AAAI'25) [paper]
[16] Penghang Yu, Zhiyi Tan, Guanming Lu, Bing-Kun Bao*. Mind Individual Information! Principal Graph Learning for Multimedia Recommendation. AAAI Conference on Artificial Intelligence, 2025. 【ORAL】 (AAAI'25) [paper] [code]
[17] Tianshan Liu, Kin-Man Lam, Bing-Kun Bao*. Injecting Text Clues for Improving Anomalous Event Detection from Weakly Labeled Videos. IEEE Transactions on Image Processing, 2024. (IEEE TIP'24) [paper]
[18] Tianshan Liu, Kin-Man Lam, Bing-Kun Bao*. A Memory-Assisted Knowledge Transferring Framework with Curriculum Anticipation for Weakly Supervised Online Activity Detection. International Journal of Computer Vision, 2024. (IJCV'24) [paper]
[19] Ming Tao, Bing-Kun Bao*, Hao Tang, Yaowei Wang, Changsheng Xu. CoIn: A Lightweight and Effective Framework for Story Visualization and Continuation. ACM Multimedia, 2024. (ACM MM'24) [paper] [code]
[20] Tianshan Liu, Kin-Man Lam, Bing-Kun Bao*. Label Text-aided Hierarchical Semantics Mining for Panoramic Activity Recognition. ACM Multimedia, 2024. (ACM MM'24) [paper]
[21] Yifan Jiao, Hantao Yao, Bing-Kun Bao, and Changsheng Xu*. Source-guided Target Feature Reconstruction for Cross-domain Classification and Detection. IEEE Transactions on Image Processing, 2024. (IEEE TIP'24) [paper]
[22] Penghang Yu, Zhiyi Tan, Guanming Lu, Bing-Kun Bao*. Multi-View Graph Convolutional Network for Multimedia Recommendation. ACM Multimedia, 2023. (ACM MM'23) [paper] [code]
[23] Bowen Yuan, Sisi You, Bing-Kun Bao*. Self-PT: Adaptive Self-Prompt Tuning for Low-Resource Visual Question Answering. ACM Multimedia, 2023. (ACM MM'23) [paper] [code]
[24] Ming Tao, Bing-Kun Bao*, Hao Tang, Changsheng Xu. GALIP: Generative Adversarial CLIPs for Text-to-Image Synthesis. IEEE Conference on Computer Vision and Pattern Recognition, 2023. (CVPR'23) [paper] [code]
[25] Sisi You, Hantao Yao, Bing-Kun Bao, Changsheng Xu. UTM: A Unified Multiple Object Tracking Model with Identity-Aware Feature Enhancement. IEEE Conference on Computer Vision and Pattern Recognition, 2023. (CVPR'23) [paper]
[26] Ming Tao, Bing-Kun Bao*, Hao Tang, Fei Wu, Longhui Wei, Qi Tian. DE-Net: Dynamic Text-guided Image Editing Adversarial Networks. AAAI Conference on Artificial Intelligence, 2023. (AAAI'23) [paper] [code]
[27] Ming Tao, Hao Tang, Fei Wu, Xiaoyuan Jing, Bing-Kun Bao*, Changsheng Xu. DF-GAN: A Simple and Effective Baseline for Text-to-Image Synthesis. IEEE Conference on Computer Vision and Pattern Recognition, 2022. 【ORAL】 (CVPR'22) [paper] [code]
[28] Jianyu Wang, Bingkun Bao*, Changsheng Xu. DualVGR: A Dual-Visual Graph Reasoning Unit for Video Question Answering. IEEE Transactions on Multimedia, 2021. (IEEE TMM'21) [paper] [code]
研究方向:
社交多媒体
面向复杂社交媒体环境,围绕社交信息理解、智能体自主适应和群体协同决策等问题,研究人工智能技术在社交环境感知、社交行为分析和复杂事件推演中的应用。
1) 社交信息理解与分析:研究文本、图像、视频及用户交互行为等多模态信息的联合建模,重点开展社会事件感知、用户行为分析、观点与情绪识别、信息传播追踪和舆情演化研判,为复杂社会信息的理解与风险预警提供技术支持。
2) 社交智能体自主进化:研究社交智能体的长期记忆、知识积累、反馈学习和自主迭代机制,使智能体能够在持续交互过程中学习社会经验、适应用户需求和环境变化,提升其长期服务能力、个性化能力和动态环境适应能力。
3) 多智能体协同博弈与群体智能:研究多智能体之间的信息共享、角色分工、任务协作、策略博弈和协商决策机制,探索复杂社会任务中的群体智能涌现规律,实现社会事件模拟、群体行为推演和多方案辅助决策。
相关研究可应用于网络舆情分析与风险预警、突发事件感知、社交平台内容治理、公共政策与社会事件推演、智能政务服务及人机协同决策等场景。

跨模态生成
围绕多模态信息的统一表征、可控生成与动态环境建模,重点开展以下研究:
1)可控图像生成与编辑:研究文本、图像、布局、姿态等多条件驱动的图像生成与编辑方法,实现生成内容在语义、结构、风格和局部细节层面的精准控制。
2)专业领域图像生成:面向医疗、遥感、工业、科学计算等专业领域,研究融合领域知识与少样本学习的高质量图像生成方法,提升模型在专业场景中的真实性、准确性与泛化能力。
3)世界模型:研究面向复杂动态环境的多模态世界建模方法,学习环境状态、物理规律和时空演化机制,支持未来场景预测、交互推演与智能决策。

视觉智能
围绕复杂开放环境中的视觉感知、场景理解与模型适应问题,重点开展以下研究:
1)工业缺陷检测:研究面向复杂工业场景的微小缺陷识别、异常检测与质量评估方法,提升模型对少样本缺陷、未知缺陷和复杂背景的检测能力。
2)低空目标感知与导航:研究无人机等低空平台的目标检测、跟踪、三维环境感知与自主导航技术,提升智能系统在动态、遮挡及复杂气象环境中的感知与决策能力。
3)跨域视觉迁移与持续学习:研究不同场景、设备和数据分布下的视觉知识迁移、领域自适应与持续学习方法,使模型能够适应环境变化并不断学习新知识,同时减少灾难性遗忘。

具身智能
围绕智能体在真实物理环境中的感知、认知、决策与行动问题,重点开展以下研究:
1) 多模态融合感知:研究视觉、语言、触觉、力觉及本体感知等多源信息的统一表征与协同融合,提升机器人对复杂环境多维的理解能力。
2) VLA驱动的导航与决策:研究视觉—语言—动作模型驱动的环境理解、任务规划、自主导航与连续决策方法,实现从自然语言指令和视觉观测到机器人动作的端到端映射。
3) 通用机器人技能学习:研究面向多任务、多场景和多机器人平台的技能表示、模仿学习、强化学习与迁移泛化方法,提升机器人技能复用、组合与持续学习能力。

脑机接口
围绕脑信息的感知、理解与临床应用,研究脑机交互中的信号采集、智能解码和闭环干预方法,重点开展以下研究:
1)脑机信息感知与采集:研究脑电、眼动、生理信号及行为信息的高质量感知与同步采集方法,提升复杂环境下脑机信号获取的稳定性、准确性与可用性。
2)脑电信号表征与解码:研究脑电信号的时空特征建模、多模态关联表征与智能解码方法,实现对认知状态、运动意图和异常脑活动的准确识别。
3)辅助诊疗闭环:研究融合脑状态感知、智能评估、辅助决策与反馈干预的闭环诊疗技术,为神经系统疾病筛查、康复训练和个性化治疗提供智能化支持。

招生信息:
本团队学生名额有限,只招收有学术和科研追求的学生,非科研之路志同道合者勿扰。本科实习生只招收未来留组读研的学生。
本团队认为的合格硕士毕业生为:(1)有独立承担横向项目的能力,或(2)发表高水平期刊或会议论文,学术有较强的创新,成果国际知名。
本团队认为的合格博士毕业生为:成果被视为研究方向的重要成果,受到广泛关注,且“个人姓名与成果关键词之间的绑定关系”受到同领域专家的认可。
暂无内容