中文

用于评估交互式叙事代理的 NARRA-Gym

计算与语言 2026-05-12 v1 计算机与社会 人机交互

摘要

交互式叙事任务要求 LLM 在多个回合中维持连贯、演变的故事并针对用户进行适应性调整。然而, 目前缺乏适合此场景的基准测试: 现有评估常关注静态提示、孤立的故事生成或事后评分, 因此忽略了模型是否能够同时管理故事生成、长程上下文状态和节奏、人物模拟、情感个性化以及 story-grounded 制品。我们引入 NARRA-Gym, 这是一个可执行的评估环境, 将稀疏情感种子转化为完整的交互式故事剧集并记录完整的模型-在回路中的轨迹, 包括故事构建、记忆更新、规划、节奏干预以及可选制品合成。我们使用受控的 LLM-as-judge sweep 对九个前沿 LLM 进行评估, 其中包括八个基准人物和人类评估, 后者对定制化模型输出进行评分。我们的结果显示, 在模型、人物和评估维度之间存在显著差异: 能够产生流畅故事的模型仍可能在鲁棒性、用户体验或敏感性个性化方面失败。这些发现表明, 交互式叙事为评估超越孤立故事质量的长期视角、用户适应性 LLM 行为提供了有用的基准。

关键词

引用

@article{arxiv.2605.08503,
  title  = {NARRA-Gym for Evaluating Interactive Narrative Agents},
  author = {Yue Huang and Yuchen Ma and Jiayi Ye and Wenjie Wang and Zipeng Ling and Xingjian Hu and Yuexing Hao and Zichen Chen and Zhangchen Xu and Yunhong He and Zhengqing Yuan and Yujun Zhou and Kehan Guo and Chaoran Chen and Toby Jia-Jun Li and Stefan Feuerriegel and Xiangliang Zhang},
  journal= {arXiv preprint arXiv:2605.08503},
  year   = {2026}
}