中文

CCSBench:面向科学文档总结的 LLM 组合可控性评估

计算与语言 2025-08-05 v3

摘要

为扩大科学知识向不同受众的传播,科学文档总结系统需要能够同时控制多个属性,如长度和经验聚焦。然而,现有研究通常只关注控制单一属性,留下了多个属性的组合控制在未充分探索。为填补这一空白,我们引入CCSBench,这是首个针对科学领域组合可控总结的评估基准。我们的基准能够对显式属性(如长度)以及隐式属性(如概念或经验聚焦)进行细粒度控制,后者更主观抽象。我们在各种大型语言模型(LLM)下进行了大量实验,包括原样学习、参数高效微调和两阶段模块方法,以平衡对不同属性的控制。我们的发现揭示了LLM在平衡控制属性之间的权衡方面存在显著局限,尤其是需要更深入理解和抽象推理的隐式属性。

关键词

引用

@article{arxiv.2410.12601,
  title  = {CCSBench: Evaluating Compositional Controllability in LLMs for Scientific Document Summarization},
  author = {Yixi Ding and Jiaying Wu and Tongyao Zhu and Yanxia Qin and Qian Liu and Min-Yen Kan},
  journal= {arXiv preprint arXiv:2410.12601},
  year   = {2025}
}

备注

Accepted to KDD 2025 SciSoc LLM Workshop: Large Language Models for Scientific and Societal Advances