中文

迈向算法保真度:合成数据与人类生成数据中跨人口统计的心理健康表示

人工智能 2024-03-26 v1 计算与语言 计算机与社会

摘要

合成数据生成有望影响数据稀缺的应用和领域。然而,在此类数据被用于心理健康等敏感任务之前,我们需要了解不同人口统计学群体在其中的表示情况。在本文中,我们通过探索 GPT-3 归因于不同种族和性别组合的各种压力源,分析了使用 GPT-3 生成合成数据的潜力,旨在为未来希望使用 LLM 进行数据生成的研究人员提供见解。使用 GPT-3,我们通过控制种族、性别和时间范围(COVID-19 之前和之后),开发了 HEADROOM,这是一个包含 3,120 篇关于抑郁症诱发压力源的合成数据集。利用该数据集,我们进行了语义和词法分析,以(1)识别每个人口统计学群体的主要压力源;并(2)将我们的合成数据与人类生成的数据集进行比较。我们展示了使用 GPT-3 生成查询以开发抑郁症数据的流程,并进行分析以揭示其分配给各人口统计学群体的压力源类型,这可用于测试 LLM 在生成抑郁症合成数据方面的局限性。我们的研究结果表明,在多样化的人口统计学群体中,合成数据模仿了部分人类生成数据在主要抑郁症压力源上的分布。

关键词

引用

@article{arxiv.2403.16909,
  title  = {Towards Algorithmic Fidelity: Mental Health Representation across Demographics in Synthetic vs. Human-generated Data},
  author = {Shinka Mori and Oana Ignat and Andrew Lee and Rada Mihalcea},
  journal= {arXiv preprint arXiv:2403.16909},
  year   = {2024}
}

备注

14 pages, 16 figures