中文

Eval4Sim:人格模拟的评估框架

计算与语言 2026-03-04 v1

摘要

具有属性、背景及行为倾向等明确规格的人格语言模型(LLM)正在日益增多地用于模拟人类对话,以完成用户建模、社会推理和行为分析等任务。确保人格驱动的模拟对人类对话行为具有忠实性因此至关重要。然而,当前的评估实践主要依赖于 LLM 评判方法,缺乏对可观察人类行为的 grounding,产生不透明的标量分数。我们提出 Eval4Sim,一种衡量模拟对话如何与人类对话模式一致的评估框架,通过三个互补维度进行衡量。Adherence 通过基于说话者感知表示的稠密检索来评估人格背景在生成语料中的隐式编码效果。Consistency 通过鉴别作者来计算人格在不同对话中是否保持可区分的身份。Naturalness 通过从对话聚焦的自然语言推理中派生的分布来衡量对话是否呈现出人类般的流畅性,而非过于僵硬或优化。与绝对或优化导向的指标不同,Eval4Sim 以人类对话语料库(即 PersonaChat)作为参考基线,并对两种偏离进行惩罚,区分不足的人格编码与过度优化的非自然行为。虽然 Eval4Sim 在 PersonaChat 上进行了演示,但其适用性扩展到任何包含说话者级别注释的对话语料库。

关键词

引用

@article{arxiv.2603.02876,
  title  = {Eval4Sim: An Evaluation Framework for Persona Simulation},
  author = {Eliseo Bao and Anxo Perez and Xi Wang and Javier Parapar},
  journal= {arXiv preprint arXiv:2603.02876},
  year   = {2026}
}