ChronusOmni:提升全能大语言模型的时间感知能力
计算与语言
2025-12-11 v1 计算机视觉与模式识别
多媒体
摘要
时间感知是全能大语言模型的一项基本能力,对于理解长视频和回答复杂问题尤为重要。以往的方法主要针对视觉语言场景,侧重于显式时间定位问题,例如识别视觉事件何时发生或确定特定时间发生什么事件。然而,这些方法通常对音频模态利用不足,且忽略了跨模态的隐式时间定位——例如,识别角色说话时视觉上存在什么,或确定视觉事件发生时说了什么——尽管此类跨模态时间关系在真实场景中普遍存在。在本文中,我们提出 ChronusOmni,一种旨在增强显式和隐式视听时间定位的时间感知能力的全能大语言模型。首先,我们在每个时间单元将基于文本的时间戳 token 与视觉和音频表示交错,实现跨模态的统一时间建模。其次,为了强制正确的时序并加强细粒度时间推理,我们引入了带有专门设计的奖励函数的强化学习。此外,我们构建了 ChronusAV,一个时间准确、模态完整且跨模态对齐的数据集,以支持视听时间定位任务的训练与评估。实验结果表明,ChronusOmni 在 ChronusAV 上取得了 SOTA 性能,提升超过 30%,并在其他时间定位基准的大多数指标上取得最佳结果。这凸显了我们的模型在跨模态间强大的时间感知能力,同时保留了通用的视频与音频理解能力。
引用
@article{arxiv.2512.09841,
title = {ChronusOmni: Improving Time Awareness of Omni Large Language Models},
author = {Yijing Chen and Yihan Wu and Kaisi Guan and Yuchen Ren and Yuyue Wang and Ruihua Song and Liyun Ru},
journal= {arXiv preprint arXiv:2512.09841},
year = {2025}
}
备注
Code available at https://github.com/YJCX330/Chronus/