Stylomech:通过英语与罗马化斯拉合语的计算体裁学揭示作者身份
计算与语言
2025-01-17 v1
摘要
随着Web 2.0的兴起,社交技术的发展与全球通信的发展在社会方面带来了积极和消极的影响。由于缺乏proper伦理,内容侵权问题和作者识别被视为至关重要,因为社会上出现了大量内容侵权。在过去的几十年中,英语和罗马化斯拉合语的作者归属识别成为主要需求。由于罗马化斯拉合语语境下尤其鲜有探索,本研究在计算语言学领域具有显著贡献。该提出的作者归属系统提供了一种独特的方法,使其仅能比较两组文本:疑似作者和匿名文本,与传统方法不同,后者通常依赖更大的语料库。该工作聚焦于使用各种相同作者和不同作者之间的数值表示,使模型能够针对这些表示进行训练,而非文本,这使其能够适用于大量作者和情境,前提是疑似作者文本和匿名文本质量合理。通过将作者归属扩展到多样化语言语境,该工作促进了数字通信中的信任和问责,尤其是在斯里兰卡。该研究在英语和罗马化斯拉合语中提出了一种开创性的方法,解决了内容验证和知识产权在数字时代的强制执行的关键需求。
引用
@article{arxiv.2501.09561,
title = {Stylomech: Unveiling Authorship via Computational Stylometry in English and Romanized Sinhala},
author = {Nabeelah Faumi and Adeepa Gunathilake and Benura Wickramanayake and Deelaka Dias and TGDK Sumanathilaka},
journal= {arXiv preprint arXiv:2501.09561},
year = {2025}
}
备注
3 figure, 1 image