捷克语和斯洛伐克语文档级主张提取的度量标准检验
计算与语言
2025-12-12 v2 人工智能
摘要
文档级主张提取在事实核查领域仍是一个开放性挑战,随着此,用于评估提取主张的方法获得了有限的关注。本文探讨了两种主张集合对齐并通过对齐得分计算其相似性的方法。我们研究了识别主张集合之间最佳对齐和评估方法的技术,旨在提供可靠的评估框架。我们的做法使我们能够在模型提取的主张集合与人工标注的主张集合之间进行比较,作为评估模型提取性能的度量标准,也可作为人类标注者间一致性的可能度量。我们在新收集的数据集上进行实验,该数据集来自捷克语和斯洛伐克语新闻评论中的主张——这些领域因非正式语言、强烈的本地语境以及这些密切相关语言的细微差别而具有额外的挑战。结果引起人们注意当前评估方法在文档级主张提取中所存在的局限性,并突显了需要更先进的方法——能够正确捕捉语义相似性并评估关键主张属性(如原子性、可核查性和去语境化)的必要性。
引用
@article{arxiv.2511.14566,
title = {Examining the Metrics for Document-Level Claim Extraction in Czech and Slovak},
author = {Lucia Makaiova and Martin Fajcik and Antonin Jarolim},
journal= {arXiv preprint arXiv:2511.14566},
year = {2025}
}