IFEval-Audio:面向音频基于大语言模型的指令遵循能力基准测试
计算与语言
2025-11-13 v2
摘要
大型语言模型(LLM)在文本任务中展现出强大的指令遵循能力。然而,这一能力在与图像或音频等非文本模态对齐后常会下降。虽然近期有研究探索了文本和视觉语言模型中的指令遵循性能,但音频基于大语言模型的指令遵循问题鲜有探讨。为填补这一空白,我们引入IFEval-Audio,一个 novel用于评估音频LLM指令遵循能力的评估数据集。IFEval-Audio包含280个音频-指令-答案三元组,涵盖六个多样化维度:内容、大小写、符号、列表结构、长度和格式。每个示例将音频输入与文本指令配对,要求模型生成遵循指定结构的输出。我们对先进的音频LLM进行了基准测试,以评估其遵循音频相关指令的能力。该数据集公开发布以支持未来在这一新兴领域的研究。
引用
@article{arxiv.2505.16774,
title = {IFEval-Audio: Benchmarking Instruction-Following Capability in Audio-based Large Language Models},
author = {Yiming Gao and Bin Wang and Chengwei Wei and Shuo Sun and AiTi Aw},
journal= {arXiv preprint arXiv:2505.16774},
year = {2025}
}
备注
Link: https://github.com/AudioLLMs/AudioBench/tree/main/IFEval-Audio