中文

了解何时作答:基于自适应置信度细化的可靠音视频问答

机器学习 2026-02-06 v1 声音

摘要

我们提出了形式化的可靠音视频问答问题 formulation,即 R\mathcal{R}-AVQA,其中我们倾向于在回答错误时选择放弃作答。虽然近期的AVQA模型准确率较高,但其识别自身可能出错能力及随之而来的放弃作答能力仍为人们所关注的薄弱环节。为填补这一空白,我们探索了多种方法,随后提出了自适应置信度细化(ACR)方法,以轻量级方式进一步提升,其中我们倾向于在回答错误时选择放弃作答。虽然近期的 AVQA 模型准确率较高,但其识别自身可能出错能力及随之而来的放弃作答能力仍为人们所关注的薄弱环节。为填补这一空白,我们探索了多种方法,随后提出了自适应置信度细化(ACR)方法,以轻量级方式进一步提升 \mathcal{R}AVQA-AVQA 的性能。我们的关键洞察在于,最大软最大概率(MSP)仅在强校准条件下才为贝叶斯最优,而这在深度神经网络,尤其是多模态模型中通常难以满足。我们并未取代 MSP,而是将其作为主要置信度信号,并在 MSP 被判定不可靠时施加输入自适应残差校正。ACR 引入两个学习头:① 预测残差风险头,用于捕捉 MSP 未能捕获的低幅度正确性残差;② 置信度门控头,用于判断 MSP 的可靠性。我们的实验和理论分析表明,ACR 在不同 AVQA 架构上,在内外分布及数据偏置设置下均一致优于现有方法,为 R\mathcal{R}-AVQA$ 任务奠定了坚实基础。代码与模型将在接受后发布,链接为 https://github.com/PhuTran1005/R-AVQA

关键词

引用

@article{arxiv.2602.04924,
  title  = {Knowing When to Answer: Adaptive Confidence Refinement for Reliable Audio-Visual Question Answering},
  author = {Dinh Phu Tran and Jihoon Jeong and Saad Wazir and Seongah Kim and Thao Do and Cem Subakan and Daeyoung Kim},
  journal= {arXiv preprint arXiv:2602.04924},
  year   = {2026}
}

备注

Technical Report