中文

通过针对性人类评判改进对话智能体的对齐

机器学习 2022-09-30 v1 计算与语言

摘要

我们提出了 Sparrow,一个信息寻求对话智能体,经训练比提示语言模型基线更具帮助性、正确性和无害性。我们使用基于人类反馈的强化学习来训练模型,并加入两项新设计以帮助人类评分者评判智能体行为。首先,为使我们的智能体更具帮助性和无害性,我们将良好对话的要求分解为智能体应遵循的自然语言规则,并分别就每条规则询问评分者。我们证明这种分解使我们能够收集更具针对性的智能体行为人类评判,并允许更高效的规则条件奖励模型。其次,我们的智能体在收集对模型陈述的偏好评判时,提供来自来源的证据以支持事实性声明。对于事实性问题,Sparrow 提供的证据在 78% 的情况下支持所采样的回复。Sparrow 比基线更受偏好,同时更能抵御人类的对抗性探测,在被探测时仅 8% 的时间违反我们的规则。最后,我们进行了广泛分析,表明尽管我们的模型学会了遵循规则,它可能表现出分布偏差。

关键词

引用

@article{arxiv.2209.14375,
  title  = {Improving alignment of dialogue agents via targeted human judgements},
  author = {Amelia Glaese and Nat McAleese and Maja Trębacz and John Aslanides and Vlad Firoiu and Timo Ewalds and Maribeth Rauh and Laura Weidinger and Martin Chadwick and Phoebe Thacker and Lucy Campbell-Gillingham and Jonathan Uesato and Po-Sen Huang and Ramona Comanescu and Fan Yang and Abigail See and Sumanth Dathathri and Rory Greig and Charlie Chen and Doug Fritz and Jaume Sanchez Elias and Richard Green and Soňa Mokrá and Nicholas Fernando and Boxi Wu and Rachel Foley and Susannah Young and Iason Gabriel and William Isaac and John Mellor and Demis Hassabis and Koray Kavukcuoglu and Lisa Anne Hendricks and Geoffrey Irving},
  journal= {arXiv preprint arXiv:2209.14375},
  year   = {2022}
}