身份背景
长期从事多模态大模型、视觉智能体(Visual Agent)与大模型推理相关研究,重点探索如何通过外部工具调用、强化学习与推理能力优化,提升大语言模型及视觉语言模型的感知、规划与多步推理能力。
具有腾讯混元多模态模型部门、上海人工智能实验室、香港中文大学及 UIUC 等科研经历,研究覆盖多模态模型、Visual Agent、LVLM幻觉、多模态安全与长序列推理等前沿课题。
研究定位
研究方向覆盖:
-
视觉智能体
:
Visual Agent、视觉工具调用、Tool Planning、Agent轨迹学习与自主工具编排
-
多模态大模型
:
VLM / LVLM、多模态感知与推理、视觉语言模型训练与能力增强
-
大模型推理
:
Multi-step Reasoning、长链推理、Process-Level Reward Model、步骤级推理评测
-
强化学习与Agent
:
强化学习优化视觉Agent、工具调用策略学习、多模态模型推理能力增强
-
可信多模态AI
:
LVLM Hallucination、多模态安全、大模型Benchmark与评测、数据构建与优化
学术成果
- 研究成果发表于 ICLR、CVPR、ACL 等人工智能、计算机视觉及自然语言处理领域顶会
- ICLR 2026 工作聚焦动态工具编排与迭代式视觉推理,研究 Visual Agent 如何自主选择并调用外部工具
- CVPR 2025 工作围绕大型视觉语言模型的数据长尾与表示均衡问题展开研究
- ACL 2025 Main 工作构建细粒度 Process-Level Reward Model Benchmark,覆盖多步推理过程评测
- 另有多模态幻觉相关成果发表于 ACM TOMM
可指导论文区位
CCF-A / CCF-B / 高水平人工智能与多模态国际会议
导师特点
具备较强的多模态大模型 , Visual Agent , 大模型推理等方向研究能力,研究技术栈覆盖视觉语言模型、Agent工具调用、多步推理、强化学习、Reward Model、Benchmark评测以及多模态模型可靠性。
尤其适合希望深入多模态大模型、Visual Agent、大模型推理、Agent强化学习、多模态后训练、VLM/LVLM、模型幻觉与大模型评测等方向,并产出相应高水平论文的学生。