中文

LALMs 时间推理基准测试与置信度评估

计算与语言 2025-05-20 v1 人工智能 机器学习 声音 音频与语音处理

摘要

文本基准大型语言模型(LLM)的流行成功已简化了多模态社区将其他模态(如视觉和音频)以及文本组合以实现类似多模态能力的注意力。在此目标下,大型音频语言模型(LALM)必须在与传统分类或生成任务不同的推理任务上进行评估。为此,我们提出了一个名为TREA(temporal reasoning evaluation of audio)的新型数据集。我们对开源LALM进行基准测试,发现它们在TREA数据集中的任务上始终落后于人类能力。在评估LALM时,我们还提出了一种不确定性度量标准,该度量标准计算模型对语义等效扰动的不变性。我们的分析表明,准确率和不确定性度量标准可能不存在必然相关性,从而指向需要对LALM进行全面评估以满足高风险应用的需求。

关键词

引用

@article{arxiv.2505.13115,
  title  = {Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning},
  author = {Debarpan Bhattacharya and Apoorva Kulkarni and Sriram Ganapathy},
  journal= {arXiv preprint arXiv:2505.13115},
  year   = {2025}
}

备注

Accepted in INTERSPEECH, 2025, Rotterdam, The Netherlands