使分类器做出与人类价值观显式对齐的判断
计算与语言
2022-10-17 v1 人工智能
摘要
许多 NLP 分类任务,如性别歧视/种族主义检测或毒性检测,都基于人类价值观。然而,人类价值观在不同文化条件下可能有所不同。因此,我们引入一种价值对齐分类框架,该框架基于命令中显式书写的人类价值观进行预测。连同该任务,我们提出一种实用方法,分两步从大规模语言模型(LLMs)中蒸馏价值对齐知识以构建价值对齐分类器。首先,我们通过基于提示的少样本学习从 LLMs 生成价值对齐训练数据。接着,我们利用生成的数据微调较小的分类模型以完成该任务。实证结果表明,我们的 VA-Models 在 F1 分数上超越多个基线至少 15.56%,包括使用 OPT-175B 的少样本学习及现有文本增强方法。我们认为,使用具有显式人类价值输入的分类器可提升 AI 的包容性与可解释性。
引用
@article{arxiv.2210.07652,
title = {Enabling Classifiers to Make Judgements Explicitly Aligned with Human Values},
author = {Yejin Bang and Tiezheng Yu and Andrea Madotto and Zhaojiang Lin and Mona Diab and Pascale Fung},
journal= {arXiv preprint arXiv:2210.07652},
year = {2022}
}