《阿卡西亚夜话》自动化修辞索引
计算与语言
2026-03-23 v1
摘要
修辞是指在民间故事中反复出现的非寻常叙事元素。除民间学者关注外,修辞亦常作为隐喻手段出现于现代新闻、文学、宣传及其他文化文本中。寻找原作民间文本中修辞的表达,有助于民间学分析(修辞索引)以及理解修辞在现代语境中的使用(修辞检测与阐释)。此前工作表明,这类问题在自动化方法中难以攻克。我们提出首个计算化修辞索引方法。数据选择是关键:我们采用广泛可得的文本(《阿卡西亚夜话》)配合2006年埃尔-什亚(El-Shamy)详细修辞索引,化解了文本可得性差的常见问题。我们构建了手动标注语料库,识别出2670个修辞表达,涵盖200种不同修辞,跨58450句进行训练与测试。我们测试了五类给定修辞索引条目检测修辞表达的方法:(1)经典检索后重排序(基于关键词与微调cross-encoder);(2)即插即用的嵌入模型;(3)微调后的嵌入模型;(4)N-shot设置下使用即插即用的大语言模型生成式提示;(5)相同生成式方法在经LoRA微调的大语言模型上实现。我们的最佳系统为微调后的Llama3模型,实现0.85的F1分数。
引用
@article{arxiv.2603.19283,
title = {Automated Motif Indexing on the Arabian Nights},
author = {Ibrahim H. Alyami and Mark A. Finlayson},
journal= {arXiv preprint arXiv:2603.19283},
year = {2026}
}
备注
30 pages, 4 figures, 9 tables Preprint. Submitted to Digital Scholarship in the Humanities(DSH) 2026