法语言学中机器学习方法的可解释性:地理语言学作者画像案例研究
计算与语言
2024-07-02 v2
摘要
法证作者画像使用语言标记来推断文本作者的特征。这一任务与方言分类相平行,后者基于文本本身对文本的语言变体做出预测。尽管近年来在语言变体分类方面取得了重大进展,但由于缺乏透明度等原因,法语言学很少依赖这些方法。因此,在本文中,我们考虑法证语境来探讨机器学习方法的可解释性。我们关注以语言变体分类作为基于德语区社交媒体数据的未知文本地理语言学画像的手段。为此,我们识别了对语言变体分类影响最大的词汇项。我们发现,提取的词汇特征确实代表了各自的语言变体,并注意到训练的模型也依赖地名进行分类。
引用
@article{arxiv.2404.18510,
title = {Explainability of machine learning approaches in forensic linguistics: a case study in geolinguistic authorship profiling},
author = {Dana Roemling and Yves Scherrer and Aleksandra Miletic},
journal= {arXiv preprint arXiv:2404.18510},
year = {2024}
}