量化与优化面向人物画像的角色扮演中的全局忠实性
计算与语言
2024-10-17 v2
摘要
面向人物画像的角色扮演(Persona-driven role-playing, PRP)旨在构建能够对用户查询作出忠实回应的人工智能角色,确保其回应始终遵循所有人物画像声明。然而,现有PRP的忠实性标准仅限于基于大型语言模型的粗粒度评分,缺乏清晰的定义或形式化表述。本文提出了一种 pioneier 的探索,旨在将PRP忠实性量化为一种细粒度且可解释的标准,这也为优化提供了可靠的参考。我们的标准首先通过识别查询-声明相关性,将人物画像声明区分为主动约束和被动约束。随后,我们遵循原则确保AI角色的回应(a)由主动(相关)约束所蕴含,且(b)不被被动(不相关)约束所矛盾。我们将这一原则数学化为一种新颖的主动-被动-约束得分(Active-Passive-Constraint, APC)得分,这是一种按相关性得分加权的自然语言推理(Natural Language Inference, NLI)得分的约束级求和。实际中,我们通过从GPT-4符号提炼小型判别器来构建APC评分系统,以提高效率。我们根据人类评估验证了APC得分的质量,选取包含数十条声明的示例人物画像,结果表明相关性很高。我们进一步将其作为直接偏好优化(Direct Preference Optimization, DPO)中的奖励系统,以获得更好的AI角色。我们的实验提供了细粒度且可解释的现有PRP技术间的比较,揭示了其优势与局限性。我们进一步发现,基于APC的DPO是保持所有约束的最具竞争力的技术之一,并且可以与其他技术良好集成。随后,我们将实验规模扩展到具有数百条声明的真实人物,结论保持一致。
引用
@article{arxiv.2405.07726,
title = {Quantifying and Optimizing Global Faithfulness in Persona-driven Role-playing},
author = {Letian Peng and Jingbo Shang},
journal= {arXiv preprint arXiv:2405.07726},
year = {2024}
}
备注
NeurIPS2024