伦理建议接受者:语言模型是否理解自然语言干预?
计算与语言
2021-06-04 v1 人工智能
机器学习
摘要
是否可以使用自然语言干预模型的行为并以期望的方式改变其预测?我们研究了自然语言干预对于阅读理解系统的有效性,并在社会刻板印象的背景下研究这一问题。具体而言,我们提出一个新的语言理解任务——语言伦理干预(Linguistic Ethical Interventions, LEI),其目标是通过向问答(QA)模型传达特定情境的伦理与公平原则,来修正该模型的不道德行为。为此,我们基于近期量化系统社会刻板印象的方法进行构建,并用不同类型的伦理干预以及模型在此类干预下的期望行为对其加以扩充。我们的零样本评估发现,即便是当今强大的神经语言模型也是极差的伦理建议接受者,即它们对伦理干预的响应出奇地少,尽管这些干预仅以简单句子表述。少样本学习改善了模型行为,但仍远未达到期望结果,尤其在各类泛化评估中。因此,我们的新任务为学界提出了一项新颖的语言理解挑战。
引用
@article{arxiv.2106.01465,
title = {Ethical-Advice Taker: Do Language Models Understand Natural Language Interventions?},
author = {Jieyu Zhao and Daniel Khashabi and Tushar Khot and Ashish Sabharwal and Kai-Wei Chang},
journal= {arXiv preprint arXiv:2106.01465},
year = {2021}
}
备注
9 pages, Findings of ACL-IJCNLP 2021