中文

基于机器学习的达罗毗荼语系代码混合文本压力检测

计算与语言 2024-10-10 v1 人工智能 人机交互 机器学习

摘要

压力是日常生活中的常见感受,但在某些情况下会影响心理健康,因此开发稳健的检测模型势在必行。本研究引入了一种系统性的方法,用于识别达罗毗荼语系代码混合文本中的压力。该挑战包含两个数据集,分别针对泰米尔语和泰卢固语。本方案强调了使用未清洗文本作为基准以改进未来分类方法的重要性,并融入了多种预处理技术。使用了随机森林算法,包含三种文本表示:TF-IDF、单词一元组以及字符(1+2+3)元组的组合。该方法在两个语言类别上都取得了良好的性能,在泰米尔语上实现了 0.734 的宏 F1 分数,在泰卢固语上实现了 0.727 的宏 F1 分数,超过了使用 FastText 和 Transformer 模型等不同复杂技术所取得的结果。结果强调了未清洗数据在心理状态检测中的价值,以及分类代码混合文本以检测压力的挑战,表明通过数据清洗、其他预处理技术或更复杂的模型有提升性能的潜力。

关键词

引用

@article{arxiv.2410.06428,
  title  = {Stress Detection on Code-Mixed Texts in Dravidian Languages using Machine Learning},
  author = {L. Ramos and M. Shahiki-Tash and Z. Ahani and A. Eponon and O. Kolesnikova and H. Calvo},
  journal= {arXiv preprint arXiv:2410.06428},
  year   = {2024}
}