中文

Aurelia:基于音视频大语言模型的测试时推理蒸馏

音频与语音处理 2025-04-01 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

近期推理优化的进展大大提升了大语言模型(LLM)的性能。然而,现有工作未能解决音视频场景的复杂性,凸显出进一步研究的需求。本文引入 AURELIA,一个基于演员-批判家的音视频(AV)推理框架,通过在测试时将结构化、逐步推理蒸馏到 AVLLM 中,从而提升其处理复杂多模态输入的能力,而无需额外训练或微调。为进一步提升 AVLLM 的推理能力,我们提出 AVReasonBench,一个包含 4500 个音视频问题的具有挑战性的基准测试,每个问题都配有详细的逐步推理过程。我们的基准测试涵盖六个不同任务,其中包括 AV-GeoIQ,用于评估结合地理和文化知识的音视频推理。对 18 个 AVLLM 在 AVReasonBench 上的评估揭示了其在多模态推理能力方面的显著局限。使用 AURELIA,我们实现了最高可达 100% 的相对改进,证明了其有效性。这一性能提升凸显了推理增强数据生成在推动 AVLLM 应用于真实世界场景方面的潜力。我们的代码和数据将在 https: //github.com/schowdhury671/aurelia 上公开。

关键词

引用

@article{arxiv.2503.23219,
  title  = {Aurelia: Test-time Reasoning Distillation in Audio-Visual LLMs},
  author = {Sanjoy Chowdhury and Hanan Gani and Nishit Anand and Sayan Nag and Ruohan Gao and Mohamed Elhoseiny and Salman Khan and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2503.23219},
  year   = {2025}
}