中文

迈向健康 AI:大语言模型也需要治疗师

人工智能 2023-04-04 v1 计算与语言 计算机与社会 人机交互 机器学习

摘要

大语言模型(LLMs)的最新进展催生了能够进行自然且类人对话的强大 AI 聊天机器人。然而,这些聊天机器人可能具有潜在危害,表现出操纵性、煤气灯效应和自恋行为。我们将健康 AI 定义为安全、可信且符合伦理的。为创建健康 AI 系统,我们提出 SafeguardGPT 框架,利用心理治疗来纠正 AI 聊天机器人中的这些有害行为。该框架包含四类 AI 智能体:聊天机器人、“用户”、“治疗师”和“评论者”。我们通过模拟社交对话的实例展示了 SafeguardGPT 的有效性。结果表明,该框架能够提升 AI 聊天机器人与人类之间的对话质量。尽管未来仍有若干挑战与方向有待解决,SafeguardGPT 为改善 AI 聊天机器人与人类价值观的对齐提供了一种有前景的途径。通过结合心理治疗与强化学习技术,该框架使 AI 聊天机器人能够以安全且符合伦理的方式学习并适应人类偏好与价值观,助力发展更具人本导向和负责任的 AI。

关键词

引用

@article{arxiv.2304.00416,
  title  = {Towards Healthy AI: Large Language Models Need Therapists Too},
  author = {Baihan Lin and Djallel Bouneffouf and Guillermo Cecchi and Kush R. Varshney},
  journal= {arXiv preprint arXiv:2304.00416},
  year   = {2023}
}