中文

Sounding Highlights:双路径音频编码器用于音视频视频高亮检测

音频与语音处理 2026-02-06 v2 人工智能 计算机视觉与模式识别 多媒体 声音

摘要

音频-视频视频高亮检测旨在利用视觉与听觉线索自动识别视频中最突出的时刻。然而,现有模型常 underutilize 音频模态,侧重于高层次语义特征,未能充分利用声音的丰富且动态的特征。为解决这一局限,我们提出一种新框架,双路径音频编码器用于视频高亮检测 (DAViHD)。双路径音频编码器由用于内容理解的语义路径组成,以及捕获语义-时间动态的动态路径。语义路径通过识别音频中的内容(如语音、音乐或特定声音事件)来提取高层次信息。动态路径在时间演变中采用频率自适应机制,联合建模这些动态特征,使其能够通过显著的频谱带和快速能量变化识别瞬态声学事件。我们将新型音频编码器集成到完整的音频-视频框架中,在大型 MrHiSum 数据集上实现了新的状态-of-the-art 性能。我们的结果表明,精细化的双面向音频表示是推动高亮检测领域发展的关键。

关键词

引用

@article{arxiv.2602.03891,
  title  = {Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection},
  author = {Seohyun Joo and Yoori Oh},
  journal= {arXiv preprint arXiv:2602.03891},
  year   = {2026}
}

备注

5 pages, 2 figures, to appear in ICASSP 2026