衡量 LLM 在交互中模拟儿童-护理员语言能力的基准测试
计算与语言
2025-09-03 v3 人工智能
摘要
LLM 能够生成类似人类的对话,但其在模拟儿童与护理员交互方面的能力仍鲜有探索。本文我们检验了 LLM 在捕捉儿童-护理员交互中独特特征的效果,采用了静态和交互式基准测试方法。我们发现,像 Llama 3 和 GPT-4o 这类最先进的 LLM 能够在词汇和说话层面近似儿童-护理员对话,但在再现儿童和护理员的话语模式、夸大对齐程度以及达到人类水平的多样性方面则走了弥合。本工作的更广泛目标是为 LLM 在儿童相关应用中的开发建立全面的基准测试框架。
引用
@article{arxiv.2412.09318,
title = {Benchmarking LLMs for Mimicking Child-Caregiver Language in Interaction},
author = {Jing Liu and Abdellah Fourtassi},
journal= {arXiv preprint arXiv:2412.09318},
year = {2025}
}