中文

评估 LLM 在时序最近开放域问题上的可靠性

计算与语言 2026-02-13 v1 人工智能

摘要

大型语言模型(LLM)正日益被部署用于开放域问答,但其对时序最近信息的人类视角对齐程度尚未得到充分探讨。我们引入 RECOM(Reddit Evaluation for Correspondence of Models),一个包含 15,000 个来自 2025 年 9 月的近期 Reddit 提问及其社区派生参考答案的基准数据集。我们调查四个开源 LLM(Llama3.1-8B、Mistral-7B、Gemma-2-9B 和 GPT-OSS-20B)对这些提问的响应方式,通过词汇指标(BLEU、ROUGE)、语义相似性(BERTScore、MoverScore、余弦相似度)和逻辑推理(NLI)进行对齐评估。我们的核心发现是一种显著的语义-词汇悖论:所有模型均实现超过 99% 的余弦相似度,但 BLEU-1 重合率不足 8%,这一差距超过 90 个百分点表明模型通过大量改写而非词汇复制来保持语义一致。MoverScore(51-53%)确认了这一模式,处于语义对齐与表层匹配之间的中间位置,反映了语义对齐的最优传输成本。此外,模型规模并不预测性能:Mistral-7B(70 亿参数)在所有指标上均超越 GPT-OSS-20B(200 亿参数)。NLI 分析显示,矛盾率保持在 7% 以下,表明模型很少生成与人类共识直接冲突的内容。这些发现挑战了基于词汇指标评估抽象生成可靠性的方法,主张采用多维度评估框架捕捉表层文本匹配之外的语义忠诚度。RECOM 数据集已公开于 https://anonymous.4open.science/r/recom-D4B0。

关键词

引用

@article{arxiv.2602.11165,
  title  = {Assessing LLM Reliability on Temporally Recent Open-Domain Questions},
  author = {Pushwitha Krishnappa and Amit Das and Vinija Jain and Tathagata Mukherjee and Aman Chadha},
  journal= {arXiv preprint arXiv:2602.11165},
  year   = {2026}
}