中文

论证挖掘中有限的泛化能力:SOTA模型学习的是数据集而非论证

计算与语言 2025-05-29 v1 人工智能 机器学习

摘要

识别论证是自动化话语分析中各种任务的必要前提,特别是在政治辩论、在线讨论和科学推理等语境中。除了在理解论证构成方面的理论进展外,随着公开可用数据集的不断增加,围绕实际论证挖掘的研究也大量涌现。在这些基准测试中,类BERT的Transformer模型始终表现最佳,这强化了人们认为此类模型广泛适用于各种辩论语境的信念。本研究对这类SOTA模型进行了首次大规模重新评估,特别关注它们在识别论证方面的泛化能力。我们在17个与该任务最相关的英语句子级数据集上评估了四个Transformer模型,包括三个标准模型和一个通过对比预训练增强了泛化能力的模型。我们的研究结果表明,这些模型在不同程度上倾向于依赖与实词相关的词汇捷径,这表明表面上的进展往往是由数据集特定的线索驱动的,而非真正的任务对齐。尽管这些模型在熟悉的基准测试上取得了优异的结果,但应用于未见过的数据集时,其性能显著下降。尽管如此,结合任务特定的预训练和联合基准训练被证明在增强鲁棒性和泛化能力方面是有效的。

关键词

引用

@article{arxiv.2505.22137,
  title  = {Limited Generalizability in Argument Mining: State-Of-The-Art Models Learn Datasets, Not Arguments},
  author = {Marc Feger and Katarina Boland and Stefan Dietze},
  journal= {arXiv preprint arXiv:2505.22137},
  year   = {2025}
}

备注

This paper has been accepted to ACL 2025 and will be published after 27.07.2025