EmoHarbor:通过模拟用户内部世界评估个性化情感支持
计算与语言
2026-01-06 v1 人机交互
摘要
当前情感支持对话的评估范式倾向于奖励通用同理响应,却未能评估支持是否真正针对用户独特的心理轮廓和情境需求进行个性化。我们提出EmoHarbor,一种采用以用户为裁判者范例的自动化评估框架,通过模拟用户的内在世界来实现评估。EmoHarbor采用链式代理架构,将用户的内部过程分解为三个专门角色,使代理能够以类似人类用户的方式与支持者交互并完成评估。我们使用覆盖多样心理特征和情境的100个真实用户档案实例化该基准,并定义10个情感支持质量的个性化维度。对20个先进大语言模型在EmoHarbor上的全面评估揭示了关键洞见:尽管这些模型在生成同理响应方面表现出色,但始终未能将支持针对个体用户情境进行针对性化。这一发现重新定义了核心挑战,将研究焦点从仅提升通用同理心,转向开发真正具备用户意识的情感支持系统。EmoHarbor提供了一个可复现且可扩展的框架,以指导更细致化和用户意识的情感支持系统的开发与评估。
引用
@article{arxiv.2601.01530,
title = {EmoHarbor: Evaluating Personalized Emotional Support by Simulating the User's Internal World},
author = {Jing Ye and Lu Xiang and Yaping Zhang and Chengqing Zong},
journal= {arXiv preprint arXiv:2601.01530},
year = {2026}
}