从个人化与主动性角度评估带工具增强的LLM
计算与语言
2025-04-15 v2
摘要
个人化工具利用是实现大语言模型(LLM)在与多种工具交互场景中符合用户偏好至关重要的。然而,目前大多数基准主要关注文本生成的个人化或直接工具调用,未能两者兼顾。本文引入了新的基准ETAPP,用于评估个人化工具调用,构建了沙盒环境和覆盖多样用户档案的800个测试案例的综合数据集。为提高评估准确性,我们提出了基于要点(keypoint)的LLM评估方法,通过手动为每个测试案例标注要点并提供给LLM作为参考,从而减轻LLM评判系统中的偏见。此外,我们评估了优秀的LLM并提供了深入分析。进一步研究了不同工具调用策略对LLM个人化性能的影响以及微调在本任务中的效果。我们也验证了我们的偏好设置和要点评估方法的有效性。我们的发现为改进个性化LLM智能体提供了见解。我们的代码已公开于https://github.com/hypasd-art/ETAPP。
引用
@article{arxiv.2503.00771,
title = {Evaluating Personalized Tool-Augmented LLMs from the Perspectives of Personalization and Proactivity},
author = {Yupu Hao and Pengfei Cao and Zhuoran Jin and Huanxuan Liao and Yubo Chen and Kang Liu and Jun Zhao},
journal= {arXiv preprint arXiv:2503.00771},
year = {2025}
}