中文

作为科学仪器的自动分类器:离真实构念更远一步

机器学习 2019-05-07 v2 机器学习

摘要

基于机器学习的各种心理与社会现象(如情绪、压力、参与度)的自动检测器在推动基础科学方面具有巨大潜力。然而,当一个检测器 dd 被训练来近似一个已有的测量工具(如问卷、观察协议)时,在使用 dd 收集的测量结果进行解释时必须谨慎,因为它们比底层构念又远了一步。我们考察了 dd 的准确度(由 dd 的输出与真实构念 UU 的相关系数 qq 量化)如何影响 UU(如压力)与另一现象 VV(如学业表现)之间估计的相关关系。具体而言:(1)我们证明,若 UUVV 的真实相关系数为 rr,则对所有与 UU 相关系数为 qq 的向量 Tn\mathcal{T}^n 而言,期望样本相关系数为 qrqr。(2)我们推导了在真实相关系数为负(反之亦然)时,使用 dd 得到的样本相关系数(基于 nn 个被试)为正的概率公式;在近期情感计算研究中所用的 nnqq 取值下,该概率可能相当可观(约 2030%20-30\%)。(3)为降低自动检测器估计相关系数的方差,我们证明,针对同一检测任务使用不同训练架构与超参数训练多个神经网络 d(1),,d(m)d^{(1)},\ldots,d^{(m)} 仅能提供对 Tn\mathcal{T}^n 有限的“覆盖”。

关键词

引用

@article{arxiv.1812.08255,
  title  = {Automatic Classifiers as Scientific Instruments: One Step Further Away from Ground-Truth},
  author = {Jacob Whitehill and Anand Ramakrishnan},
  journal= {arXiv preprint arXiv:1812.08255},
  year   = {2019}
}