中文

GQVis:面向生成式人工智能的基因组数据问题与可视化数据集

基因组学 2025-10-17 v1 人工智能 人机交互 机器学习

摘要

数据可视化是基因组研究中的基本工具,使我们能够探索、解释和交流复杂的基因组特征。虽然机器学习模型在将数据转化为富有洞察力的可视化方面显示出前景,但当前模型缺乏面向特定领域任务的训练基础。在为基因组领域模型训练提供基础资源的努力中,我们提出了一个框架,用于生成将抽象、低层次关于基因组数据的问题与相应可视化配对的数据集。基于统计图表的先行工作,我们的方法适应于基因组数据的复杂性以及用于描绘它们的专用表示。我们进一步包含多个链接查询和可视化,以及每个数据集项目的设计选择依据、图表说明和图像替代文本。我们使用来自三个不同基因组数据存储库(4DN、ENCODE、Chromoscope)的基因组数据,产生GQVis:由114万单个查询数据点、62.8万查询对和58.9万查询链组成的数据集。GQVis数据集和生成代码分别可在https://huggingface.co/datasets/HIDIVE/GQVis和https://github.com/hms-dbmi/GQVis-Generation获得。

关键词

引用

@article{arxiv.2510.13816,
  title  = {GQVis: A Dataset of Genomics Data Questions and Visualizations for Generative AI},
  author = {Skylar Sargent Walters and Arthea Valderrama and Thomas C. Smits and David Kouřil and Huyen N. Nguyen and Sehi L'Yi and Devin Lange and Nils Gehlenborg},
  journal= {arXiv preprint arXiv:2510.13816},
  year   = {2025}
}