PARSI:基于风格度量集成的波斯语作者识别
计算与语言
2025-06-30 v1 人工智能
摘要
波斯古典诗歌中复杂的语言、风格和韵律方面为计算作曲归属识别带来挑战。本文提出一种通用框架,用于确定67位著名诗人的作者身份。我们采用包含基于转换器的语言编码器,以及针对波斯诗歌语义、风格度量和韵律维度的特征的多输入神经框架。我们的特征集合包括100维的Word2Vec嵌入、七个风格度量指标以及诗歌形式和韵律的分类编码。我们构建了包含647,653首诗的大型语料库,经过严格的预处理和作者验证,同时保持诗歌级别的划分以防止重叠。本文采用逐句分类和多数投票及加权投票方案进行评估,发现加权投票法可达71%准确率。我们进一步研究基于阈值的决策过滤,使模型能够生成高度自信的预测,在0.9阈值下达到97%的准确率,但覆盖率较低。本文聚焦于深度表征形式与领域特定特征的集成,以提高作曲归属识别效果。结果表明,我们的方法对于自动化分类以及风格分析、作曲争议和一般计算文学研究都具有潜力。该研究将促进多语言作曲归属、风格迁移及波斯诗歌生成建模的进一步研究。
引用
@article{arxiv.2506.21840,
title = {PARSI: Persian Authorship Recognition via Stylometric Integration},
author = {Kourosh Shahnazari and Mohammadali Keshtparvar and Seyed Moein Ayyoubzadeh},
journal= {arXiv preprint arXiv:2506.21840},
year = {2025}
}