Transformer 模型能否度量文本连贯性?对 Shuffle 测试的反思
计算与语言
2021-07-09 v1
摘要
Shuffle 测试是评估 NLP 模型能否度量文本连贯性最常见的任务。近期多数工作在该任务上采用直接监督;我们展示仅通过微调一个 RoBERTa 模型,即可达到 97.8% 的近完美准确率,即当前最优(SOTA)。我们认为这种出色表现不太可能带来良好的文本连贯性模型,并建议 Shuffle 测试应在零样本(Zero-Shot)设定下开展:模型应在未经该任务训练的情况下被评估。我们在该设定下评估了常见模型,如生成式与双向 Transformer,发现更大的架构开箱即用地实现了高性能。最后,我们提出 k-Block Shuffle 测试,通过增大被打乱块的大小对原测试进行改进。尽管人类读者表现仍高(约 95% 准确率),模型性能随块增大从 94% 降至 78%,从而构建了一个概念上简单的基准挑战以评测 NLP 模型。代码见:https://github.com/tingofurro/shuffle_test/
引用
@article{arxiv.2107.03448,
title = {Can Transformer Models Measure Coherence In Text? Re-Thinking the Shuffle Test},
author = {Philippe Laban and Luke Dai and Lucas Bandarkar and Marti A. Hearst},
journal= {arXiv preprint arXiv:2107.03448},
year = {2021}
}
备注
Accepted at ACL-IJCNLP 2021 (short paper), 7 pages, 4 figures