个人化悖论:语义损失与智能体 AI Q&A 中的推理收益
信息检索
2026-05-19 v1
摘要
用于学生咨询的代理化检索增强型大语言模型 AIVisor,用于检验个人化如何在多个评估维度上影响系统性能。我们使用十二个旨在检验词汇精确度的真实咨询问题,比较十种个人化与非个人化系统配置,并借助线性混合效应模型在词汇(BLEU、ROUGE-L)、语义(METEOR、BERTScore)和 grounding(RAGAS)指标上进行分析。结果显示,个人化在推理质量和 grounding 方面可靠地提升,但在语义相似度上引入显著负向相互作用,其原因并非答案变差,而是当前评估指标的局限——它们惩罚了对通用参考文本的有意见数化偏差。这揭示了当前大语言模型评估方法的结构性缺陷,其不适用于评估面向用户的响应。完全集成的个人化配置获得最高的整体提升,表明在采用恰当的多维评估指标时,个人化可提升系统效果。总体而言,本研究表明个人化导致指标依赖性的变动,而非一致的改进,为基于更透明和稳健方法的个人化提供了方法论基础。
引用
@article{arxiv.2512.04343,
title = {The Personalization Paradox: Semantic Loss vs. Reasoning Gains in Agentic AI Q&A},
author = {Satyajit Movidi and Stephen Russell},
journal= {arXiv preprint arXiv:2512.04343},
year = {2026}
}