大型语言模型是否为情境个性化摘要器?获取一个 iCOPERNICUS 测试!
计算与语言
2024-10-02 v1 机器学习
神经与进化计算
摘要
大型语言模型(LLM)在基于情境学习(ICL)的摘要中取得了显著进展。然而,摘要的显著性取决于用户的具体偏好历史。因此,我们需要在此类 LLM 中实现可靠的情境个性化学习(ICPL)能力。对于任意 LLM 要实现 ICPL,需具备辨别用户轮廓差异的能力。近期研究首次提出衡量模型对用户轮廓差异响应程度的度量标准 EGISES。然而,EGISES 无法测试模型是否利用了 ICPL 提示中提供的三类线索:(i) 示例摘要;(ii) 用户的阅读历史;(iii) 用户轮廓的差异。为此,我们提出了 iCOPERNICUS 框架,即 In-COntext PERsonalization learNing sCrUtiny of Summarization capability in LLMs(面向 LLMs 中情境个性化学习概要能力的新型框架),其使用 EGISES 作为比较度量。作为案例研究,我们评估了 17 个最先进的 LLM 基于其报告的 ICL 性能,并发现 15 个模型在使用更丰富的提示被探测时,ICPL 降低(最小下降 1.6%;最大下降 3.6%),从而显示其缺乏真正的 ICPL。
引用
@article{arxiv.2410.00149,
title = {Are Large Language Models In-Context Personalized Summarizers? Get an iCOPERNICUS Test Done!},
author = {Divya Patel and Pathik Patel and Ankush Chander and Sourish Dasgupta and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2410.00149},
year = {2024}
}