道德完整性语料库:面向伦理对话系统的基准
计算与语言
2022-04-08 v1
摘要
对话智能体在开放域对话场景中已日益接近人类水平;然而,此类模型可能表现出不敏感、伤人或不连贯的观点,从而削弱用户对其系统道德完整性的信任。道德偏差难以缓解,因为道德判断并非普适,且对同一情境可能同时存在多种相互竞争的评判。本工作中,我们引入一项新资源,并非要权威地解决道德模糊性,而是促进对对话系统话语中所反映的直觉、价值观与道德判断的系统性理解。道德完整性语料库(MIC)正是这样一项资源,其利用 99k 条不同的经验法则(RoTs)刻画了 38k 个提示-回复对的道德假设。每条 RoT 反映一种特定的道德信念,可解释聊天机器人的回复为何看似可接受或存在问题。我们进一步用一组 9 个道德与社会属性对 RoT 进行组织,并针对属性分类给出基准性能。最重要的是,我们表明当前神经语言模型可自动生成合理描述此前未见交互的新 RoT,但在某些场景下仍力有不逮。我们的发现表明,MIC 将成为理解语言模型隐含道德假设并灵活基准评测对话智能体完整性的有用资源。下载数据见 https://github.com/GT-SALT/mic
引用
@article{arxiv.2204.03021,
title = {The Moral Integrity Corpus: A Benchmark for Ethical Dialogue Systems},
author = {Caleb Ziems and Jane A. Yu and Yi-Chia Wang and Alon Halevy and Diyi Yang},
journal= {arXiv preprint arXiv:2204.03021},
year = {2022}
}
备注
ACL 2022 main conference