中文

为高级聊天机器人添加护栏

计算机与社会 2023-06-14 v1 人工智能 计算与语言

摘要

生成式AI模型持续变得更加强大。2022年11月ChatGPT的发布开启了AI的新时代。ChatGPT及其他类似聊天机器人具备一系列能力,从回答学生作业问题到创作音乐与艺术。人们已担忧人类可能在多种工作中被聊天机器人取代。由于聊天机器人所基于的数据谱系广泛,我们知道它们将内置人类错误与人类偏见。这些偏见可能对不同子群体造成显著危害和/或不公。为理解聊天机器人响应的优势与弱点,我们呈现一篇立场论文,探究ChatGPT的不同用例,以确定哪些类型问题被公平回答、哪些仍待改进。我们发现,对于我们测试的任务,ChatGPT是一个公平的搜索引擎;然而,其在文本生成与代码生成上均存在偏见。我们发现ChatGPT对提示词的变化非常敏感,微小改动会导致不同水平的公平性。这表明我们需要立即实施“纠正”或缓解策略以提升这些系统的公平性。我们建议了改进聊天机器人的不同策略,并倡导设立一个可访问模型参数的公正审查小组,以衡量不同类型偏见的程度,进而推荐 safeguards( safeguards:保障措施)以迈向歧视更少、更准确的响应。

关键词

引用

@article{arxiv.2306.07500,
  title  = {Adding guardrails to advanced chatbots},
  author = {Yanchen Wang and Lisa Singh},
  journal= {arXiv preprint arXiv:2306.07500},
  year   = {2023}
}