长视频理解中的 Token 压缩
研究问题: 长视频输入导致上下文窗口爆炸,推理成本高。
Research Gap: 现有压缩方法容易丢失时序关键事件。
核心方法: 事件感知的多粒度 Token 压缩与记忆机制。
创新点: 保留任务相关时序线索的压缩策略。
推荐 Baseline: LLaVA-Video / 长视频 VLM 基线
潜在实验: 长视频问答准确率、压缩率与延迟。
研究问题: 长视频输入导致上下文窗口爆炸,推理成本高。
Research Gap: 现有压缩方法容易丢失时序关键事件。
核心方法: 事件感知的多粒度 Token 压缩与记忆机制。
创新点: 保留任务相关时序线索的压缩策略。
推荐 Baseline: LLaVA-Video / 长视频 VLM 基线
潜在实验: 长视频问答准确率、压缩率与延迟。