中文

MATCHA:基于对比语义对齐的文本匹配

计算与语言 2026-05-27 v1

摘要

可靠的评估对于理解大型语言模型(LLM)性能至关重要,但当今主流的指标——即基于token重叠的评分(如ROUGE)和基于嵌入的措施(如BERTScore),常常误判文档的语义相似性。我们的研究表明,无论是token重叠指标还是基于嵌入的指标,都会对直接相互矛盾的文本分配近似相同的分数,从而可能掩盖根本性的错误。我们引入MATCHA,一种自动评估指标,既奖励与参考文本的语义一致性,又惩罚矛盾。MATCHA采用双视图方法,衡量(i)与黄金文本的接近度,以及(ii)来自对抗生成的反事实矛盾文本的距离。在八个公开基准测试中,MATCHA在多个任务上优于流行指标,这些任务包括问答、图像描述生成、自然语言推理、摘要和语义文本相似性。在TruthfulQA数据集上(即一个没有训练集的数据集,其中没有本地训练embedding-based指标的可能性),与ROUGE-L和BERTScore相比,匹配文本的改进幅度分别达到了18.38%和20.82%。定性人类评估和定量比较均确认了MATCHA的有效性和有效性,并揭示了现有指标的根本性弱点。与23个嵌入模型(包括顶级最先进模型)类似用作BERTScore等指标的模型相比,MATCHA在仅基于参考文本的情况下,仍能最准确地区分正确与错误的陈述。我们的代码和指标已公开发布(https://github.com/Siran-Li/MATCHA)。

关键词

引用

@article{arxiv.2605.27345,
  title  = {MATCHA: Matching Text via Contrastive Semantic Alignment},
  author = {Siran Li and Ece Sena Etoglu and Carsten Eickhoff and Seyed Ali Bahrainian},
  journal= {arXiv preprint arXiv:2605.27345},
  year   = {2026}
}