中文

文档相似度度量中的关键因素:ASPECTSIM 框架

计算与语言 2026-01-08 v1

摘要

我们提出 ASPECTSIM,一个简单且可解释的框架,将文档相似度置于明确指定的因素之上,这与传统的整体方法不同。我们构建了包含 2.6 万个因素-文档对的新基准数据集,并通过直接使用 GPT-4o 提示发现,ASPECTSIM 在人机一致性(约高出 80%)上显著优于无明确因素的整体相似度。这些发现凸显了在衡量文档相似度时显式考虑因素的重要性,并提示需要修订标准做法。随后,我们进行了大规模的元评估,使用 16 个小型开源 LLM 和 9 个嵌入模型,重点在于使 ASPECTSIM 可访问且可复现。虽然直接使用 LLM 提示生成 ASPECTSIM 分数人机一致性较差(仅 20-30%),但简单的两阶段精炼可使一致性提升约 140%。然而,一致性仍低于 GPT-4o 类模型,表明小型开源 LLM 在捕捉因素条件化相似度方面仍落后于大型专有模型。

关键词

引用

@article{arxiv.2601.03435,
  title  = {The Critical Role of Aspects in Measuring Document Similarity},
  author = {Eftekhar Hossain and Tarnika Hazra and Ahatesham Bhuiyan and Santu Karmaker},
  journal= {arXiv preprint arXiv:2601.03435},
  year   = {2026}
}

备注

24 Pages, 10 Figures, 10 Tables