中文

从个人化与主动性角度评估带工具增强的LLM

计算与语言 2025-04-15 v2

摘要

个人化工具利用是实现大语言模型(LLM)在与多种工具交互场景中符合用户偏好至关重要的。然而,目前大多数基准主要关注文本生成的个人化或直接工具调用,未能两者兼顾。本文引入了新的基准ETAPP,用于评估个人化工具调用,构建了沙盒环境和覆盖多样用户档案的800个测试案例的综合数据集。为提高评估准确性,我们提出了基于要点(keypoint)的LLM评估方法,通过手动为每个测试案例标注要点并提供给LLM作为参考,从而减轻LLM评判系统中的偏见。此外,我们评估了优秀的LLM并提供了深入分析。进一步研究了不同工具调用策略对LLM个人化性能的影响以及微调在本任务中的效果。我们也验证了我们的偏好设置和要点评估方法的有效性。我们的发现为改进个性化LLM智能体提供了见解。我们的代码已公开于https://github.com/hypasd-art/ETAPP。

关键词

引用

@article{arxiv.2503.00771,
  title  = {Evaluating Personalized Tool-Augmented LLMs from the Perspectives of Personalization and Proactivity},
  author = {Yupu Hao and Pengfei Cao and Zhuoran Jin and Huanxuan Liao and Yubo Chen and Kang Liu and Jun Zhao},
  journal= {arXiv preprint arXiv:2503.00771},
  year   = {2025}
}