基于内部知识评估大语言模型书籍摘要:跨模型与语义一致性方法
计算与语言
2025-03-28 v1
摘要
我们研究了大语言模型(LLMs)是否能仅凭内部知识生成全面且准确的书籍摘要,而无需依赖原始文本。通过采用多样化的书籍和多种 LLM 架构,我们检验这些模型是否能够综合出与人类解释相吻合的有意义叙事。评估采用 LLM 作为评判者范式:每个 AI 生成的摘要都与高质量的人类书面摘要进行比较,跨模型评估中,所有参与 LLM 都评估不仅是他们自己的输出,也评估来自其他模型的输出。这种方法使我们能够识别潜在偏差,例如模型倾向于偏好自己生成的摘要风格而非他人。此外,使用 ROUGE 和 BERTScore 指标量化人类书面摘要与 LLM 生成摘要之间的对齐程度,评估语法和语义对应的深度。结果揭示了模型在内容表征和风格偏好方面的细微差异,凸显了依赖内部知识进行摘要任务的优势与局限。这些发现加深了对 LLM 内部事实信息编码及跨模型评估动态的理解,对开发更稳健的自然语言生成系统具有深远意义。
引用
@article{arxiv.2503.21613,
title = {Evaluating book summaries from internal knowledge in Large Language Models: a cross-model and semantic consistency approach},
author = {Javier Coronado-Blázquez},
journal= {arXiv preprint arXiv:2503.21613},
year = {2025}
}
备注
22 pages, 6 figures