中文

利用弱监督信号修复不安全的对话回复

计算与语言 2023-05-26 v1 人工智能

摘要

近年来,大规模对话系统的不安全回复生成问题日益引发关注,即智能体将从真实语料中学习到攻击性或偏见行为。已有一些方法以流水线风格检测并替换不安全训练样本来解决上述问题。尽管有效,它们面临标注成本高、对未见场景及对抗攻击适应性差的问题。此外,忽视提供安全回复(例如简单用模板替换)会导致对话的信息缺失问题。为解决这些问题,我们提出一种无监督伪标签采样方法TEMP,可自动分配潜在安全回复。具体而言,我们的TEMP方法受簇中不安全样本通常较少且分布于尾部的观察启发,将回复分入若干簇,并以自适应锐化采样策略采样多个标签。在闲聊和任务导向对话中的大量实验表明,我们的TEMP优于具有弱监督信号的state-of-the-art模型,并在无监督学习设定下取得可比结果。

关键词

引用

@article{arxiv.2305.15757,
  title  = {Healing Unsafe Dialogue Responses with Weak Supervision Signals},
  author = {Zi Liang and Pinghui Wang and Ruofei Zhang and Shuo Zhang and Xiaofan Ye Yi Huang and Junlan Feng},
  journal= {arXiv preprint arXiv:2305.15757},
  year   = {2023}
}