中文

用于文本偏见检测的拓扑与机器学习当前应用

计算机与社会 2023-11-23 v1 计算与语言 机器学习

摘要

制度性偏见会影响患者结局、教育成就和法律系统导航。书面记录常反映偏见,一旦识别出偏见,便可转介相关人员进行培训以减少偏见。现有许多机器学习工具可探索文本数据并构建预测模型,从而检索书面记录以识别实时偏见。然而,以往极少有研究考察大语言模型嵌入与偏见文本数据的几何模型,以理解几何对偏见建模精度的影响。为克服此问题,本研究利用 RedditBias 数据库分析文本偏见。考察了包括 BERT 与 RoBERTa 变体在内的四种 transformer 模型。嵌入后,t-SNE 实现了数据的二维可视化。KNN 分类器区分偏见类型,其中较低的 k 值更为有效。结果表明 BERT(尤其是 mini BERT)在偏见分类中表现优异,而多语言模型表现滞后。建议强调精炼单语模型并探索特定领域偏见。

关键词

引用

@article{arxiv.2311.13495,
  title  = {Current Topological and Machine Learning Applications for Bias Detection in Text},
  author = {Colleen Farrelly and Yashbir Singh and Quincy A. Hathaway and Gunnar Carlsson and Ashok Choudhary and Rahul Paul and Gianfranco Doretto and Yassine Himeur and Shadi Atalls and Wathiq Mansoor},
  journal= {arXiv preprint arXiv:2311.13495},
  year   = {2023}
}