中文

ROMA:基于交互式流式理解的实时全光谱多模态助手

计算机视觉与模式识别 2026-01-16 v1 计算与语言

摘要

近期的全光谱多模态大语言模型在统一建模音频、视觉和文本方面显示出前景。然而,流式音视频理解仍具有挑战性,因为现有方法存在能力不完整或缺乏自主式主动监控的局限。为此,我们提出ROMA,一款用于统一响应式和主动式交互的实时全光谱多模态助手。ROMA 处理连续输入作为同步的多模态单元,将稠密音频与离散视频帧对齐,以处理粒度不匹配。对于在线决策,我们引入轻量级 speak head,将响应触发与生成解耦,以确保精确触发且无任务冲突。我们采用精选的流式数据集和两阶段课程训练ROMA,逐步优化流式格式适应性和主动响应性。为统一碎片化评估生态,我们将多样化基准重新组织为覆盖主动(警报、叙述)和响应(问答)场景的统一套件。广泛实验表明,ROMA在主动任务上实现了SOTA性能,在响应设置中表现出竞争力,验证了其在统一实时全光谱多模态理解中的鲁棒性。

关键词

引用

@article{arxiv.2601.10323,
  title  = {ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding},
  author = {Xueyun Tian and Wei Li and Bingbing Xu and Heng Dong and Yuanzhuo Wang and Huawei Shen},
  journal= {arXiv preprint arXiv:2601.10323},
  year   = {2026}
}

备注

Our project page is available at https://eureka-maggie.github.io/ROMA_show