中文

公元首千年拉丁文本中句子级性内容检测

计算与语言 2024-03-27 v3 人工智能

摘要

在本研究中,我们提议评估深度学习方法进行句子级语义分类以加速人文与语言学领域的语料库构建过程,这是一项传统且耗时的任务。我们引入一个新颖语料库,包含约2500个句子,时间跨度为公元前300年至公元900年,涵盖性语义(医学、情色等)。我们评估了多种句子分类方法和不同输入嵌入层,并表明它们都一致优于简单的基于词元的搜索。我们探索了个人语言风格和社会方言元数据嵌入(世纪、作者、写作类型)的整合,但发现会导致过拟合。我们的结果证明了该方法的有效性,使用HAN分别取得了70.60%和86.33%的高精确率与真正率(TPR)。我们评估了数据集规模对模型性能的影响(420而非2013),并表明尽管我们的模型表现更差,但仍提供足够高的精确率和TPR,即使无MLM也分别达69%和51%。鉴于该结果,我们提供了对注意力机制的分析,作为对人文研究者产出更多数据的支持性附加价值。

关键词

引用

@article{arxiv.2309.14974,
  title  = {Detecting Sexual Content at the Sentence Level in First Millennium Latin Texts},
  author = {Thibault Clérice},
  journal= {arXiv preprint arXiv:2309.14974},
  year   = {2024}
}