应对算法(误)信息分类中的偶然性:迈向负责任的机器学习议程
摘要
机器学习(ML)驱动的分类模型正日益普及,用以应对海量且高速传播的在线错误信息及其他可能被视为有害的内容。在构建这些模型时,数据科学家需要对用于模型训练与测试的“真相”来源的合法性、权威性与客观性表明立场。这具有政治、伦理与认知层面的意涵,而技术论文中鲜少论及。尽管(且正是由于)其所报告的高准确率与高性能,ML 驱动的审核系统有可能塑造在线公共讨论,并产生诸如不当审查与强化错误信念等下游负面影响。借助协作民族志及来自科学与社会研究、专长研究领域的理论洞见,我们对构建用于(误)信息分类的 ML 模型的过程予以批判性分析:我们识别出一系列算法偶然性——即模型开发中的关键时刻,当这些工具被社交媒体平台部署时,可能导致不同的未来结果、不确定性及有害效应。最后,我们为反思性与负责任的 ML 工具开发以审核在线错误信息及其他有害内容,提供了一条暂行的路径。
引用
@article{arxiv.2210.09014,
title = {Addressing contingency in algorithmic (mis)information classification: Toward a responsible machine learning agenda},
author = {Andrés Domínguez Hernández and Richard Owen and Dan Saattrup Nielsen and Ryan McConville},
journal= {arXiv preprint arXiv:2210.09014},
year = {2023}
}
备注
Andr\'es Dom\'inguez Hern\'andez, Richard Owen, Dan Saattrup Nielsen and Ryan McConville. 2023. Addressing contingency in algorithmic (mis)information classification: Toward a responsible machine learning agenda. Accepted in 2023 ACM Conference on Fairness, Accountability, and Transparency (FAccT '23), June 12-15, 2023, Chicago, United States of America. ACM, New York, NY, USA, 16 pages