hallucination 还是创造力:如何评估 AI 生成的科学故事?
计算与语言
2026-03-20 v2 人工智能
摘要
生成式 AI 可将科学文章转化为针对不同受众的叙事,但评估这些故事 remains 挑战。叙事需要抽象、简化和教育性的创造力——这些品质通常未被标准摘要度量很好地捕捉。与此同时,事实性 hallucination 在科学语境中至关重要,但检测器往往误分类合法的叙事重构或在创造力涉及时证明不稳定。在本工作中,我们提出了 StoryScore,用于评估 AI 生成的科学故事的复合度量。StoryScore 将语义对齐、词汇 grounding、叙事控制、结构忠实性、冗余避免和实体级 hallucination 检测集成到统一框架中。我们的分析也揭示了为何许多 hallucination 检测方法难以区分教育性创造力和事实错误,突显关键局限:虽然自动度量能够有效评估与原始内容的语义相似性,但它们在评估叙述方式和控制方式方面困难重重。
引用
@article{arxiv.2602.02290,
title = {Hallucination or Creativity: How to Evaluate AI-Generated Scientific Stories?},
author = {Alex Argese and Pasquale Lisena and Raphaël Troncy},
journal= {arXiv preprint arXiv:2602.02290},
year = {2026}
}