面向细粒度时序感知:基于音频侧时间提示的后训练大音频语言模型
声音
2026-04-16 v1 人工智能
摘要
大音频语言模型(LALM)实现了广泛的音频理解任务,展现出卓越的性能。然而,这些模型在时序感知(例如推断事件的开始和结束时间)方面仍面临挑战,限制了其在细粒度场景中的实用性。为此,我们提出音频侧时间提示(Audio-Side Time Prompt),并利用强化学习(RL)构建TimePro-RL框架,以实现细粒度时序感知。具体而言,我们将时间戳编码为嵌入向量,并在音频特征序列中交错插入作为时序坐标的提示。进一步,我们引入RL following 有监督微调(SFT)以直接优化时序对齐性能。实验表明,TimePro-RL在音频 grounding、声音事件检测和密集音频描述等多项音频时序任务上均实现显著性能提升,验证了其稳健的有效性。
引用
@article{arxiv.2604.13715,
title = {Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt},
author = {Yanfeng Shi and Pengfei Cai and Jun Liu and Qing Gu and Nan Jiang and Lirong Dai and Ian McLoughlin and Yan Song},
journal= {arXiv preprint arXiv:2604.13715},
year = {2026}
}
备注
Submitted to Interspeech 2026