LALMs 时间推理基准测试与置信度评估
计算与语言
2025-05-20 v1 人工智能
机器学习
声音
音频与语音处理
摘要
文本基准大型语言模型(LLM)的流行成功已简化了多模态社区将其他模态(如视觉和音频)以及文本组合以实现类似多模态能力的注意力。在此目标下,大型音频语言模型(LALM)必须在与传统分类或生成任务不同的推理任务上进行评估。为此,我们提出了一个名为TREA(temporal reasoning evaluation of audio)的新型数据集。我们对开源LALM进行基准测试,发现它们在TREA数据集中的任务上始终落后于人类能力。在评估LALM时,我们还提出了一种不确定性度量标准,该度量标准计算模型对语义等效扰动的不变性。我们的分析表明,准确率和不确定性度量标准可能不存在必然相关性,从而指向需要对LALM进行全面评估以满足高风险应用的需求。
引用
@article{arxiv.2505.13115,
title = {Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning},
author = {Debarpan Bhattacharya and Apoorva Kulkarni and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2505.13115},
year = {2025}
}
备注
Accepted in INTERSPEECH, 2025, Rotterdam, The Netherlands