利用基础模型以极小监督检测违规策略
计算与语言
2023-06-13 v1 人工智能
摘要
基础模型,即在大型文本语料上预训练的大型神经网络,已彻底改变了NLP。它们可被直接指令化(例如(arXiv:2005.14165))——这称为硬提示(hard prompting)——并且可使用极少数据微调(例如(arXiv:2104.08691))——该技术称为软提示(soft prompting)。我们试图利用其能力来检测策略违规。我们的贡献如下:我们确定了将思维链提示适配于策略违规任务的硬提示。该提示产生策略违规分类,以及证明该分类的抽取式解释。我们将硬提示与软提示微调组合,产生一个仅需极少监督即可达到高精度的分类器;该分类器同时产生解释。尽管监督仅作用于分类,我们发现修改后的解释仍与(微调后)模型的响应一致。在此过程中,我们确定了基础模型若干反直觉的方面。例如,添加某个特定类的样本反而会减少该类预测,以及另外,分词对打分等的影响。基于我们的技术结果,我们为产品团队确定了一个简单工作流,以快速开发高效的策略违规检测器。
引用
@article{arxiv.2306.06234,
title = {Using Foundation Models to Detect Policy Violations with Minimal Supervision},
author = {Sid Mittal and Vineet Gupta and Frederick Liu and Mukund Sundararajan},
journal= {arXiv preprint arXiv:2306.06234},
year = {2023}
}
备注
16 pages