BERT嵌入是否编码了叙事维度?对小说中时间、空间、因果和角色的词元级探测分析
计算与语言
2026-04-14 v1 人工智能
摘要
叙事理解需要多维语义结构。本研究调查了BERT嵌入是否编码了虚构叙事语义的维度——时间、空间、因果和角色。使用LLM加速标注,我们构建了一个用这四个叙事类别加上“其他”进行标注的词元级数据集。在BERT嵌入上的线性探测(94%准确率)显著优于在方差匹配的随机嵌入上的控制探测(47%),证实了BERT编码了有意义的叙事信息。通过平衡类别权重,探测实现了0.83的宏平均召回率,在稀有类别如因果(召回率=0.75)和空间(召回率=0.66)上取得中等成功。然而,混淆矩阵分析揭示了“边界泄漏”,即稀有维度被系统地误分类为“其他”。聚类分析表明,无监督聚类与预定义类别几乎随机对齐(ARI=0.081),这表明叙事维度被编码,但并非作为离散可分离的簇。未来工作包括仅词性标注基线以区分句法模式与叙事编码、扩展数据集以及逐层探测。
引用
@article{arxiv.2604.10786,
title = {Do BERT Embeddings Encode Narrative Dimensions? A Token-Level Probing Analysis of Time, Space, Causality, and Character in Fiction},
author = {Beicheng Bei and Hannah Hyesun Chun and Chen Guo and Arwa Saghiri},
journal= {arXiv preprint arXiv:2604.10786},
year = {2026}
}
备注
13 pages, 7 figures. Accepted at CMN'26 (9th International Workshop on Computational Models of Narrative)