了解何时作答:基于自适应置信度细化的可靠音视频问答
机器学习
2026-02-06 v1 声音
摘要
我们提出了形式化的可靠音视频问答问题 formulation,即 -AVQA\mathcal{R} 的性能。我们的关键洞察在于,最大软最大概率(MSP)仅在强校准条件下才为贝叶斯最优,而这在深度神经网络,尤其是多模态模型中通常难以满足。我们并未取代 MSP,而是将其作为主要置信度信号,并在 MSP 被判定不可靠时施加输入自适应残差校正。ACR 引入两个学习头:① 预测残差风险头,用于捕捉 MSP 未能捕获的低幅度正确性残差;② 置信度门控头,用于判断 MSP 的可靠性。我们的实验和理论分析表明,ACR 在不同 AVQA 架构上,在内外分布及数据偏置设置下均一致优于现有方法,为 -AVQA$ 任务奠定了坚实基础。代码与模型将在接受后发布,链接为 https://github.com/PhuTran1005/R-AVQA
引用
@article{arxiv.2602.04924,
title = {Knowing When to Answer: Adaptive Confidence Refinement for Reliable Audio-Visual Question Answering},
author = {Dinh Phu Tran and Jihoon Jeong and Saad Wazir and Seongah Kim and Thao Do and Cem Subakan and Daeyoung Kim},
journal= {arXiv preprint arXiv:2602.04924},
year = {2026}
}
备注
Technical Report