关于儿童语音障碍文献分类的技术报告
计算与语言
2025-05-21 v1 信息检索
机器学习
声音
音频与语音处理
摘要
本技术报告介绍了一种基于自然语言处理(NLP)的用于系统性分类儿童语音障碍文献的方法。我们从PubMed数据库中检索并筛选了4804篇2015年之后的相关文章,使用领域特定关键词。在清洗和预处理摘要后,我们应用了两种主题建模技术——潜在 Dirichlet 分析(LDA)和BERTopic,以识别语料库中潜在的主题结构。我们的模型发现了14个临床上有意义的聚类,如婴幼素活性和异常癫痫行为。为提高相关性和精度,我们采用了针对言语发育病学定制的停用词列表。评估结果显示,LDA模型获得了0.42的一致性得分和-7.5的perplexity,表明主题具有良好一致性和预测性能。BERTopic模型显示异常主题比例不足20%,表明其有效地对异构文献进行分类。这些结果为自动化言语发育病学文献综述提供了基础。
引用
@article{arxiv.2505.14242,
title = {Technical Report on classification of literature related to children speech disorder},
author = {Ziang Wang and Amir Aryani},
journal= {arXiv preprint arXiv:2505.14242},
year = {2025}
}