TAC:时间戳音频描述
声音
2026-02-18 v1
摘要
大型音频语言模型在复杂声学场景中难以消除重叠事件,导致时间上不一致的描述和频繁的幻觉现象。我们介绍Timestamped Audio Captioner(TAC),一种产生不同程度细节和分辨率的时序锚定音频描述的模型。TAC通过构建具有挑战性和动态混合的合成数据管道,从真实世界音频来源生成数据,使其能够在真实多音轨条件下进行稳健学习。在事件检测和密集描述方面,TAC超越了所有竞争方法,幻觉率低,时间锚定准确。我们还引入TAC-V,用于生成语义丰富的音视频描述。随后我们表明,TAC和TAC-V作为"语义桥梁”:一个简单的TAC→LLM和TAC-V→LLM级联在音频(MMAU-Pro、MMSU、MMAR)和音视频(DailyOmni、VideoHolmes)理解和推理基准上实现最先进的成绩。
引用
@article{arxiv.2602.15766,
title = {TAC: Timestamped Audio Captioning},
author = {Sonal Kumar and Prem Seetharaman and Ke Chen and Oriol Nieto and Jiaqi Su and Zhepei Wang and Rithesh Kumar and Dinesh Manocha and Nicholas J. Bryan and Zeyu Jin and Justin Salamon},
journal= {arXiv preprint arXiv:2602.15766},
year = {2026}
}