中文

衡量 LLM 在交互中模拟儿童-护理员语言能力的基准测试

计算与语言 2025-09-03 v3 人工智能

摘要

LLM 能够生成类似人类的对话,但其在模拟儿童与护理员交互方面的能力仍鲜有探索。本文我们检验了 LLM 在捕捉儿童-护理员交互中独特特征的效果,采用了静态和交互式基准测试方法。我们发现,像 Llama 3 和 GPT-4o 这类最先进的 LLM 能够在词汇和说话层面近似儿童-护理员对话,但在再现儿童和护理员的话语模式、夸大对齐程度以及达到人类水平的多样性方面则走了弥合。本工作的更广泛目标是为 LLM 在儿童相关应用中的开发建立全面的基准测试框架。

关键词

引用

@article{arxiv.2412.09318,
  title  = {Benchmarking LLMs for Mimicking Child-Caregiver Language in Interaction},
  author = {Jing Liu and Abdellah Fourtassi},
  journal= {arXiv preprint arXiv:2412.09318},
  year   = {2025}
}