数字之下:基于定量与定性方法的 LLM 抑郁预测中的性别公平性分析
计算与语言
2024-06-17 v2
摘要
近期研究表明,许多用于抑郁检测的机器学习模型中存在偏见,但 LLM 用于此任务的偏见尚未被探讨。本工作首次尝试使用定量和定性方法探讨现有 LLM (ChatGPT, LLaMA 2, 和 Bard) 在性别公平性方面的偏差程度。从定量评估来看,ChatGPT 在各种性能指标上表现最佳,LLaMA 2 在组公平性指标方面优于其他 LLM。由于定性公平性评估仍是开放的研究问题,我们提出了若干策略(例如 word count, 主题分析)以探讨定性评估是否及如何为偏差分析提供有价值的见解,超出定量评估所能实现的范围。我们发现 ChatGPT 在其预测中提供的解释 consistently 更为全面、论证更充分,compared to LLaMA 2。我们还识别了 LLM 用于定性评估性别公平性的若干主题。我们希望这些结果可作为改进 LLM 定性公平性评估的基石,尤其是对于高风险任务如抑郁检测。
引用
@article{arxiv.2406.08183,
title = {Underneath the Numbers: Quantitative and Qualitative Gender Fairness in LLMs for Depression Prediction},
author = {Micol Spitale and Jiaee Cheong and Hatice Gunes},
journal= {arXiv preprint arXiv:2406.08183},
year = {2024}
}