输入顺序塑造LLM在多文档摘要中的语义对齐
计算与语言
2025-12-03 v1
摘要
大语言模型(LLM)如今被用于诸如Google AI概览等场景,用于对多个长文档进行摘要。然而,是否对所有输入赋予相等权重仍不清楚。我们聚焦于堕胎相关新闻,构建40篇中性文章三元组,将每个三元组置换为六种输入顺序,并提示Gemini 2.5 Flash生成中性概览。我们使用ROUGE-L(词汇重叠)、BERTScore(语义相似性)和SummaC(事实一致性)对每个摘要与其来源文章进行评估。单向方差分析显示,BERTScore在所有立场中都存在显著的 primacy 效应,表明摘要与首次看到的文章更语义对齐。成对比较进一步显示,位置1与位置2和位置3显著不同,而后者彼此之间没有显著差异,确认了对第一篇文档的选择性偏好。这些发现为依赖LLM生成概览的应用以及代理AI系统提供了风险,因为涉及LLM的步骤可能对下游动作产生不成比例的影响。
引用
@article{arxiv.2512.02665,
title = {Input Order Shapes LLM Semantic Alignment in Multi-Document Summarization},
author = {Jing Ma},
journal= {arXiv preprint arXiv:2512.02665},
year = {2025}
}
备注
9 pages, 3 figures, 2 tables