中文

FicSim:面向长篇虚构作品多层面语义相似度的数据集

计算与语言 2026-01-21 v2

摘要

随着语言模型处理日益冗长和复杂文本的能力不断增强,计算文学研究领域对其应用的兴趣也日益浓厚。然而,由于对长篇文本进行细粒度标注的成本高昂,以及使用公有领域文献所固有的数据污染问题,评估这些模型在此类任务中的效用仍然充满挑战。当前的嵌入相似度数据集因侧重于粗粒度相似度且主要针对极短文本,并不适用于评估文学领域的任务。我们整理并发布了FICSIM,这是一个由近期创作的长篇虚构作品构成的数据集,包含了基于作者提供的元数据并经数字人文学者验证的12个相似度轴上的评分。我们在此任务上评估了一系列嵌入模型,结果表明这些模型普遍倾向于关注表层特征,而非对计算文学研究任务有用的语义类别。在整个数据收集过程中,我们优先考虑作者的自主权,并依赖于持续、知情的作者同意。

关键词

引用

@article{arxiv.2510.20926,
  title  = {FicSim: A Dataset for Multi-Faceted Semantic Similarity in Long-Form Fiction},
  author = {Natasha Johnson and Amanda Bertsch and Maria-Emil Deal and Emma Strubell},
  journal= {arXiv preprint arXiv:2510.20926},
  year   = {2026}
}

备注

Published in Findings of EMNLP 2025