大型语言模型智能体性格与响应恰当性:由人类语言专家、LLM 评判者及自然语言处理模型进行评估
人机交互
2025-10-29 v1
摘要
尽管大型语言模型(LLM)基于智能体可通过提示人格特征和情境数据创建高度互动的应用程序,但有效评估其性格仍具有挑战性。本文提出一种新颖的跨学科方法,以解决这一问题,通过结合智能体开发和语言学分析来评估 LLM 基于智能体的性格在诗歌解释任务中的提示性格。我们开发了一种新颖且灵活的题目库,依据语言学评估标准和人类认知学习水平,提供比当前方法更全面的评估。通过使用自然语言处理模型、其他 LLM 和人类专家评估智能体响应,我们的发现揭示了纯深度学习解决方案的局限性,强调跨学科设计在智能体开发中的关键作用。
引用
@article{arxiv.2510.23875,
title = {Large Language Model Agent Personality and Response Appropriateness: Evaluation by Human Linguistic Experts, LLM-as-Judge, and Natural Language Processing Model},
author = {Eswari Jayakumar and Niladri Sekhar Dash and Debasmita Mukherjee},
journal= {arXiv preprint arXiv:2510.23875},
year = {2025}
}