中文

AI 文本到行为:一项关于可控性的研究

人工智能 2023-08-16 v1 计算与语言 机器学习

摘要

本研究探讨了大语言模型(LLMs)的可控性,特别是 OpenAI 的 ChatGPT 迭代版本。通过采用称为 OCEAN(开放性、尽责性、外向性、宜人性、神经质)的行为心理学框架,我们定量衡量了模型对定制提示的响应能力。当被要求生成模仿外向人格的文本时,OCEAN 对该语言与那一行为特质的对齐程度进行了评分。在我们的分析中,虽然“开放性”呈现出语言歧义,“尽责性”和“神经质”在 OCEAN 框架中被明确唤起,而“外向性”和“宜人性”展现出显著的重叠但仍与其他特质明显分离。我们的发现强调了 GPT 的通用性以及辨别并适应细微指令的能力。此外,历史人物模拟凸显了 LLM 内化并投射可指示人格的能力,精确复现其哲学与对话风格。然而,LLM 能力的快速进步以及某些训练技术的不透明性使得度量提议迅速退化。我们的研究强调以定量角色描述 LLM 中的可控性,既呈现其前景,也指出将其进展与人类意图对齐方面有待进一步完善之处。

关键词

引用

@article{arxiv.2308.07326,
  title  = {AI Text-to-Behavior: A Study In Steerability},
  author = {David Noever and Sam Hyams},
  journal= {arXiv preprint arXiv:2308.07326},
  year   = {2023}
}