ChildEval:当大语言模型遇见儿童个性
计算与语言
2026-05-28 v1 人工智能
摘要
虽然大语言模型(LLM)使得个性化聊天机器人成为可能,但它们在以儿童为中心的个性化方面的有效性仍不明确,因为目前仍缺乏对儿童特定偏好的系统性评估。为填补这一空白,我们引入了ChildEval,一个用于评估大语言模型在长上下文对话中推断并遵循儿童中心偏好的能力的基准。ChildEval包含29,000个合成的3-6岁儿童个性档案,提供相对静态的背景信息。每个个性档案都与一个儿童偏好相关联——该偏好可能与个性档案一致、冲突或独立——并通过单句显式表达或通过6-10轮对话隐式表达。显式和隐式偏好旨在反映相同的潜在偏好,但表达方式不同,捕捉了偏好表达的动态方面,而非静态个性的变化。该基准涵盖五个顶层类别和十四个子类别,覆盖儿童的日常生活与发展。我们进一步提出了细粒度、以儿童为中心的评估协议,以系统评估开源大语言模型。实验结果表明,不同的个性化表示如何影响大语言模型的响应,并表明在ChildEval上进行微调可以提升以儿童为中心的性能。我们的代码和数据集可在 https://github.com/ziyanluo/ChildEval 获取。
引用
@article{arxiv.2605.27805,
title = {ChildEval: When large language models meet children's personalities},
author = {Yanyan Luo and Xue Han and Chunxu Zhao and Ruiqiao Bai and Yaxing Zhang and Qian Hu and Lijun Mei and Junlan Feng},
journal= {arXiv preprint arXiv:2605.27805},
year = {2026}
}
备注
8 pages of main text (ACL Findings format), with references and appendix