中文

HITSnDIFFs:从真相发现到能力发现——通过恢复具有连续1性质的矩阵

社会与信息网络 2024-01-02 v1 数据库 数据结构与算法 机器学习

摘要

我们分析了一个众包环境中的一般问题:一个用户提问(也称为项目),其他用户返回该问题的答案(也称为标签)。与现有众包工作侧重于为问题找到最合适的标签(“真相”)不同,我们的问题是根据用户回答问题的能力确定用户的排名。我们将此问题称为“能力发现”,以强调与更深入研究的“真相发现”问题的联系和对偶性。为了以原则性的方式对项目及其标签进行建模,我们借鉴了项目反应理论(IRT),该理论是SAT和GRE等标准化测试广泛接受的理论。我们从理想化设置开始,其中用户的相对表现在项目间一致,且能力更强的用户为每个项目选择更合适的标签。我们假设,针对我们更一般问题的原则性算法解决方案应能正确解决这一理想设置,并观察到该设置中的响应矩阵满足连续1性质(C1P)。虽然C1P在算法上已被充分理解,有多种离散算法,但我们设计了一种新颖的HITS算法变体,称为“HITSNDIFFS”(HND),并证明它能在存在C1P排列的情况下恢复该排列。与寻找连续1排列(如果存在)的快速组合算法不同,HND在不存在这种排列时也会返回一个排序。因此,它为我们的问题提供了一种原则性的启发式方法,保证在理想设置下返回正确答案。我们的实验表明,与最先进的真相发现方法相比,HND产生的用户排名具有稳健的高准确性。我们还表明,我们新颖的HITS变体在用户数量上的扩展性优于ABH,后者是先前唯一的谱C1P重建算法。

关键词

引用

@article{arxiv.2401.00013,
  title  = {HITSnDIFFs: From Truth Discovery to Ability Discovery by Recovering Matrices with the Consecutive Ones Property},
  author = {Zixuan Chen and Subhodeep Mitra and R Ravi and Wolfgang Gatterbauer},
  journal= {arXiv preprint arXiv:2401.00013},
  year   = {2024}
}

备注

22 pages, 14 figures, long version of of ICDE 2024 conference paper