中文

评估大语言模型生成年龄适合儿童式对话的能力

计算与语言 2025-10-29 v1

摘要

大型语言模型(LLM)主要基于成人对话数据训练,面临着在生成针对特定应用中适合儿童的真实、儿童式对话方面存在显著挑战。我们present 对比研究,评估五种不同的 LLM(GPT-4、RUTER-LLAMA-2-13b、GPTSW、NorMistral-7b 和 NorBloom-7b)用于生成 5 岁和 9 岁儿童的年龄适当挪威语对话。通过 11 名教育专业人员的盲目评估,使用真实儿童访谈数据和 LLM 生成的文本样本,我们评估了其真实性和发展适当性。我们的结果显示,评估者实现了强大的区间可靠性(ICC=0.75),并在较年轻儿童(5 岁儿童)的年龄预测中比较老儿童(9 岁儿童)的准确性更高。虽然 GPT-4 和 NorBloom-7b 在一定程度上表现较好,但大多数模型生成的语言被认为比目标年龄群更语言上高级。这些发现凸显了在开发针对儿童的 LLM 系统的关键数据相关挑战,尤其是在低资源语言中,综合的年龄适当词汇资源较为稀缺。

关键词

引用

@article{arxiv.2510.24250,
  title  = {Evaluating LLMs on Generating Age-Appropriate Child-Like Conversations},
  author = {Syed Zohaib Hassan and Pål Halvorsen and Miriam S. Johnson and Pierre Lison},
  journal= {arXiv preprint arXiv:2510.24250},
  year   = {2025}
}

备注

11 pages excluding references and appendix. 3 figures and 6 tables