中文

机器学习在人类学中的使用与误用

机器学习 2022-09-08 v1 计算机视觉与模式识别

摘要

机器学习(ML)现已广泛面向广大研究界开放,促进了这些新兴数学技术在广泛学科中大量新颖而引人注目的应用。在本文中,我们将聚焦于一个具体案例:古人类学领域,其试图基于生物和文化证据理解人属的演化。正如我们将展示的,ML算法的易得性以及人类学研究界对其正确使用的专业知识的缺乏,导致了文献中普遍出现基础性误用。由此产生的不可靠结果不仅破坏了将ML合法纳入人类学研究的努力,还产生了关于我们人类演化和行为过去的潜在错误认识。本文旨在简要介绍ML在古人类学中的一些应用方式;我们还包含了对一些基本ML算法的综述,供未完全熟悉该领域者参考,该领域仍在积极发展。我们讨论了一系列在累积的人类学文献中令人不安地频繁出现的ML方法的失误、错误和违反正确协议的情况。这些错误包括使用过时的算法和实践;不恰当的训练/测试划分、样本构成和文本解释;以及因缺乏数据/代码共享而导致的透明度缺失,并对独立复现施加了后续限制。我们主张,扩大样本、共享数据和代码、重新评估同行评审方法,以及最重要的,组建包含ML专家的跨学科团队,对于未来在人类学中纳入ML的研究进展都是必要的。

关键词

引用

@article{arxiv.2209.02811,
  title  = {Use and Misuse of Machine Learning in Anthropology},
  author = {Jeff Calder and Reed Coil and Annie Melton and Peter J. Olver and Gilbert Tostevin and Katrina Yezzi-Woodley},
  journal= {arXiv preprint arXiv:2209.02811},
  year   = {2022}
}