评估LLM网络代理的文化与社会意识
计算与语言
2025-03-11 v3
摘要
随着大语言模型(LLMs)扩展到在传统自然语言处理任务之外的真实应用中充当代理,评估其鲁棒性变得愈发重要。然而,现有的基准测试往往忽略文化与社交意识等关键维度。为此,我们提出了CASA,一个旨在评估LLM代理在两项基于网络的任务——在线购物和社交讨论论坛——中对文化与社会规范的敏感性的基准。我们的方法评估LLM代理检测并适当回应违反规范的用户查询和观察的能力。此外,我们提出了一套全面的评估框架,用于衡量意识覆盖率、管理用户查询的有效性以及面对误导性网络内容时的违规率。实验表明,当前LLM在非代理环境中表现显著优于基于网络的代理环境,代理的意识覆盖率不足10%,违规率超过40%。为提升性能,我们探索了两种方法:提示(prompting)和微调(fine-tuning),并发现结合两种方法可以带来互补优势——在文化特定数据集上的微调显著增强了代理跨不同区域的泛化能力,而提示则提升了代理处理复杂任务的能力。这些发现强调了在开发周期中持续对LLM代理的文化与社交意识进行基准测试的重要性。
引用
@article{arxiv.2410.23252,
title = {Evaluating Cultural and Social Awareness of LLM Web Agents},
author = {Haoyi Qiu and Alexander R. Fabbri and Divyansh Agarwal and Kung-Hsiang Huang and Sarah Tan and Nanyun Peng and Chien-Sheng Wu},
journal= {arXiv preprint arXiv:2410.23252},
year = {2025}
}
备注
NAACL 2025 Findings