基于语言模型域自适应的句子论点相似性度量的实证研究
计算与语言
2021-02-22 v1
摘要
度量两个不同句子论点之间的相似性是论点挖掘中的一项重要任务。然而,该领域的挑战之一在于数据集必须使用多主题的专业知识进行标注,使得基于标注数据的监督学习成本高昂。在本文中,我们探究了该问题是否可通过迁移学习得到缓解。我们首先利用自监督学习将预训练语言模型适配到感兴趣的领域。随后,我们将该模型微调至一个度量来自不同领域的句子之间相似性的任务。在无监督设定下,相较具有竞争力的基线模型,我们的方法在 Argument Facet Similarity 数据集上提升了与人类标注相似性分数的相关性。此外,仅使用约 60% 的标注数据样本,我们便取得了与全监督基线模型相当的性能。我们认为,我们的工作暗示了构建面向多种争论主题的通用论点聚类模型的可能性。
引用
@article{arxiv.2102.09786,
title = {An Empirical Study on Measuring the Similarity of Sentential Arguments with Language Model Domain Adaptation},
author = {ChaeHun Park and Sangwoo Seo},
journal= {arXiv preprint arXiv:2102.09786},
year = {2021}
}
备注
4+2 pages