文档连贯性建模评测
计算与语言
2021-03-19 v1 人工智能
摘要
尽管预训练语言模型(LM)在词法-句法和语义任务上取得了令人印象深刻的增益,它们对语篇和语用现象的建模能力尚不明晰。作为更好理解其语篇建模能力的一步,我们提出一个句子侵入检测任务。我们考察了多种预训练 LM 在英语该检测任务上的表现。由于缺乏该任务的数据集,我们引入了 INSteD,一个新颖的侵入句检测数据集,包含由英语维基百科和 CNN 新闻文章构建的 170,000+ 文档。我们的实验显示,预训练 LM 在域内评测中表现优异,但在跨域设定下性能大幅下降,表明泛化能力有限。在一个新颖的语言学探测数据集上的进一步结果显示仍有较大改进空间,尤其在跨域设定下。
引用
@article{arxiv.2103.10133,
title = {Evaluating Document Coherence Modelling},
author = {Aili Shen and Meladel Mistica and Bahar Salehi and Hang Li and Timothy Baldwin and Jianzhong Qi},
journal= {arXiv preprint arXiv:2103.10133},
year = {2021}
}
备注
accepted to TACL 2021