Multimodal AI

多模态

多模态研究关注跨模态表征、对齐与推理,服务理解、生成和 Agent 等下游任务。

微信咨询该方向
多模态

Research Ideas

长视频理解中的 Token 压缩

研究问题: 长视频输入导致上下文窗口爆炸,推理成本高。

Research Gap: 现有压缩方法容易丢失时序关键事件。

核心方法: 事件感知的多粒度 Token 压缩与记忆机制。

创新点: 保留任务相关时序线索的压缩策略。

推荐 Baseline: LLaVA-Video / 长视频 VLM 基线

潜在实验: 长视频问答准确率、压缩率与延迟。

推荐技术栈

PyTorchTransformersCLIPQwen-VL / LLaVAFlashAttention

潜在投稿会议

CVPRICCVECCVACM MMICLRNeurIPSACL