KnowMe-Bench:面向终身数字伴侣的人物理解基准测试
人工智能
2026-04-21 v2 信息检索
摘要
现有的长程记忆基准大多使用多轮对话或合成的用户历史,这使得检索性能成为人物理解的不完美代理指标。我们提出了 \BenchName,这是一个基于长篇自传体叙事构建的公开可发布基准,其中行动、情境和内心活动为推断稳定的动机和决策原则提供了密集的证据。\BenchName 将每段叙事重构为具有闪回感知、时间锚定的流,并通过涵盖事实回忆、主观状态归因和原则级推理的带证据链接的问题来评估模型。在多样化的叙事来源中,检索增强系统主要提高了事实准确性,但在时间锚定的解释和更高层次的推理上仍存在错误,凸显了对超越检索的记忆机制的需求。我们的数据位于 \href{KnowMeBench}{https://github.com/QuantaAlpha/KnowMeBench}。
引用
@article{arxiv.2601.04745,
title = {KnowMe-Bench: Benchmarking Person Understanding for Lifelong Digital Companions},
author = {Tingyu Wu and Zhisheng Chen and Ziyan Weng and Shuhe Wang and Chenglong Li and Shuo Zhang and Sen Hu and Silin Wu and Qizhen Lan and Huacan Wang and Ronghao Chen},
journal= {arXiv preprint arXiv:2601.04745},
year = {2026}
}