LatentOmni:通过统一音视频潜空间推理重思全模态理解
计算与语言
2026-05-22 v1 计算机视觉与模式识别
摘要
联合音视频推理是全模态理解的关键,但当前的多模态大语言模型(MLLMs)在需要来自两种模态细粒度证据的推理时仍感到困难。一个核心限制是,显式的文本链式思维(CoT)将连续音视频信号压缩为离散标记,削弱了时间对齐并将中间推理转向语言先验。我们认为统一的潜空间是更好的推理媒介,因为它既保留了稠密感官信息,又与自回归生成兼容。基于此洞见,我们提出了 LatentOmni,这是一个交错的文本推理与音视频潜状态的跨模态推理框架。LatentOmni 引入特征级监督以将潜推理状态与任务相关的感官特征对齐,并使用 Omni-Sync Position Embedding(OSPE)维持音视频潜状态之间的时间一致性。我们进一步构建了 LatentOmni-Instruct-35K,这是一个用于监督潜空间推理的音视频交错推理轨迹数据集。全面评估表明,LatentOmni 在多个音视频推理基准测试中实现了最佳性能, consistently 超过 Explicit Text CoT 基线,支持潜空间联合推理作为更强全模态理解的可行路径。
引用
@article{arxiv.2605.22012,
title = {LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning},
author = {Yifan Dai and Zhenhua Wu and Bohan Zeng and Daili Hua and Jialing Liu and Bozhou Li and Yuran Wang and Chengzhuo Tong and Hao Liang and Xiaochen Ma and Junbo Niu and Tianyu Guo and Yang Shi and Yue Ding and Yiyan Ji and Bingyin Mei and Yushuo Guan and Yuanxing Zhang and Pengfei Wan and Fangcheng Fu and Wentao Zhang},
journal= {arXiv preprint arXiv:2605.22012},
year = {2026}
}
备注
21 pages, 15 figures