中文

语篇解析中至关重要的变化:估计领域偏移对解析器误差的影响

计算与语言 2022-03-23 v1 机器学习

摘要

语篇分析使我们能够获得超越句子层级的文本文档推断。当前的语篇模型在训练分布覆盖范围之外的文本上性能很低,削弱了现有模型的实际效用。我们需要一种度量,能够告知我们在训练样本与测试样本可能来自不同分布时,模型从训练样本到测试样本的泛化程度。虽然这可以通过分布偏移来估计,但我们认为这并不直接对应于分类器观测误差的变化(即误差间隙)。因此,我们提出使用理论领域自适应文献中的一个统计量,该量可直接与误差间隙相关联。我们从理论上并通过在包括新闻、生物医学文本、TED 演讲、Reddit 帖子和小说等在内的 6 个语篇数据集上超过 2400 次实验的大规模实证研究,研究了该统计量作为误差间隙估计量的偏差。我们的结果不仅论证了我们的提议并帮助理解其局限性,还为改进领域自适应中性能的语篇模型与数据集属性提供了见解。例如,我们发现当训练集与测试集差异很大时,非新闻数据集比新闻数据集略易迁移。我们的代码及相关的 Python 包已公开,以便从业者做出更明智的模型与数据集选择。

关键词

引用

@article{arxiv.2203.11317,
  title  = {The Change that Matters in Discourse Parsing: Estimating the Impact of Domain Shift on Parser Error},
  author = {Katherine Atwell and Anthony Sicilia and Seong Jae Hwang and Malihe Alikhani},
  journal= {arXiv preprint arXiv:2203.11317},
  year   = {2022}
}