中文

Pet-Bench:面向社交网络服务中的大语言模型 E-Pet 能力的基准测试

计算与语言 2025-12-16 v3

摘要

随着对使用大语言模型进行交互式和情感丰富体验的兴趣增长,虚拟宠物伴侣服务作为一种新型且尚未充分探索的应用不断引人关注。现有方法侧重于基础的宠物角色扮演交互,而未系统性地对大语言模型进行全面伴侣能力的基准测试。本文引入 Pet-Bench,一个专门用于评估大语言模型在自我互动和人类互动维度上能力的基准测试。与先前工作不同,Pet-Bench 强调自我演化和发展行为,以及交互式互动,提供更真实地反映宠物伴侣的体验。其包含多样化的任务,如智能调度、基于记忆的对话和心理对话,设计了超过 7,500 个互动实例以模拟宠物行为。对 28 个大语言模型的评估显示,性能在模型规模和内在能力方面存在显著差异,凸显了该领域需要专门优化的必要性。Pet-Bench 为大语言模型宠物相关能力的基准测试提供了基础资源,推动了充满情感的 human-pet 互动的发展。

关键词

引用

@article{arxiv.2506.03761,
  title  = {Pet-Bench: Benchmarking the Abilities of Large Language Models as E-Pets in Social Network Services},
  author = {Hongcheng Guo and Zheyong Xie and Shaosheng Cao and Boyang Wang and Weiting Liu and Zheyu Ye and Zhoujun Li and Zuozhu Liu and Wei Lu},
  journal= {arXiv preprint arXiv:2506.03761},
  year   = {2025}
}