大型音频语言模型中音频压缩下的任务感知答案保留
音频与语音处理
2026-05-08 v1
摘要
大型音频语言模型 (LALMs) 越来越多地被用于对长音频片段进行推理,然而在实际部署中,为了降低内存和延迟,通常会在推理前对音频进行压缩。其风险在于,压缩可能会使总体准确率保持在可接受水平,但会急剧降低对部署至关重要的特定查询族的答案质量。我们研究了保留答案的音频压缩,通过压缩器引发的额外答案错误来评估其优劣,特别是针对受影响最严重的查询族。我们在理论上将其表述为压缩器接受-拒绝准则,推导出一种实用的签发协议,该协议返回的压缩预算能够以统计置信度满足最坏查询族检查,并在五个多选音频问答基准上使用两个基于 Qwen 的骨干模型进行了评估。该协议揭示了隐藏的族级损害,表明所选的查询族划分会改变批准的预算,并确定了查询条件压缩有助于保持答案的适用场景。
引用
@article{arxiv.2605.06631,
title = {Task-Aware Answer Preservation under Audio Compression for Large Audio Language Models},
author = {Amir Ivry},
journal= {arXiv preprint arXiv:2605.06631},
year = {2026}
}
备注
Preprint