俄语诗歌文本中的拼写与语法异常检测
计算与语言
2025-05-08 v1
摘要
微调数据集中自然语言文本的质量对生成模型的性能起着关键作用,尤其是在诗歌或歌词生成等计算创意任务中。生成诗歌中的流畅性缺陷会显著降低其价值。然而,训练文本通常来自缺乏严格质量控制的互联网平台,这给数据工程师有效管理缺陷水平带来了挑战。为了解决这个问题,我们提出使用自动化语言异常检测来识别并从创意模型的训练数据集中过滤掉低质量文本。在本文中,我们利用合成数据集和人工标注数据集,对无监督和有监督的文本异常检测方法进行了全面比较。我们还介绍了 RUPOR 数据集,这是一个为跨句语法错误检测而设计的俄语人工标注诗歌集合,并提供了完整的评估代码。我们的工作旨在为社区提供工具和见解,以提高创意领域生成模型训练数据集的质量。
引用
@article{arxiv.2505.04507,
title = {Detecting Spelling and Grammatical Anomalies in Russian Poetry Texts},
author = {Ilya Koziev},
journal= {arXiv preprint arXiv:2505.04507},
year = {2025}
}