中文

SMILE:一种用于问答评估的复合词汇-语义指标

计算与语言 2025-11-24 v1 人工智能 计算机视觉与模式识别

摘要

传统的文本和视觉问答评估指标,如 ROUGE、METEOR 和精确匹配 (EM),高度依赖基于 n 元语法的词汇相似性,往往忽略所需的深层语义理解。虽然 BERTScore 和 MoverScore 等措施利用情境嵌入来缓解这一限制,但它们缺乏灵活的在句子级语义与关键词级语义之间进行平衡的能力,同时忽略词汇相似性——后者仍然重要。大型语言模型 (LLM) 基于的评估器虽强大,但存在高成本、偏差、不一致性和幻觉等问题。为此,我们引入 SMILE:语义指标集成词汇精确性,一种新方法将句子级语义理解与关键词级语义理解以及易于关键词匹配相结合。该复合方法在词汇精确度和语义相关性之间实现了平衡,提供了全面的评估。广泛的基准测试覆盖文本、图像和视频 QA 任务,表明 SMILE 与人类判断高度相关且计算开销轻低,弥合了词汇评估与语义评估之间的鸿沟。

关键词

引用

@article{arxiv.2511.17432,
  title  = {SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation},
  author = {Shrikant Kendre and Austin Xu and Honglu Zhou and Michael Ryoo and Shafiq Joty and Juan Carlos Niebles},
  journal= {arXiv preprint arXiv:2511.17432},
  year   = {2025}
}

备注

23 pages, 6 tables, 9 figures