北京基因组钻研所(国度生物信息中心)原始数据治理系统(GSA Family)研发获得新进展
8月14日,GA黄金甲(国度生物信息中心)国度基因组科学数据中心(CNCB-NGDC)在国际学术期刊Genomics,Proteomics & Bioinformatics在线颁发题为“The Genome Sequence Archive Family: Toward Explosive Data Growth and Diverse Data Types”的文章,GSA数据库系统接受全世界科研工作者的数据提交,汇交和治理各种类型的数据,并对所有公开可用数据提供免费盛开接见,支持性命科学钻研。
组学原始数据归档库(GSA)是性命组学原始测序数据治理的公益性数据库,旨在推动全球性命组学数据的共享与利用。近年来,随着组学数据的爆炸性增长和数据类型的多样化,以及人类遗传资源数据治理的特殊需要,CNCB-NGDC对GSA数据库进行了更新和扩大,形成了GSA数据库系统,蕴含GSA,GSA-Human和OMIX。
GSA数据库与2017颁布的版本相比,在数据模型、系统职能和数据提交方式等方面进行了更新和职能提升;GSA-Human是存储人类遗传资源数据的数据库,可实现人类遗传资源数据的受控接见,保险人类遗传资源数据的安全性;OMIX数据库存储非原始测序数据,如环境组、表型组、代谢组等,它作为上述两种数据资源库的沉要补充,有效地解决了用户提交除原始测序数据表的其它类型数据的需要。
截至2021年8月14日,GSA和GSA-Human已网络的数据量达到9.5 PB,OMIX上线不久数据量已达到1.6 TB。GSA数据库系统已为全球111个国度/地域的用户提供数据服务,均匀每天的数据下载量达到4 TB,已成为Elsevier、Wiley、 Taylor & Francis 、Cell及 Springer Nature出版集团指定的核酸数据归档库,获得领域内所有国内表主流期刊的认可。
北京基因组所(国度生物信息中心)国度基因组科学数据中心的陈婷婷、陈旭、张思思、朱军伟工程师为该文共同第一作者,王彦青高级工程师、章张钻研员、赵文化正高级工程师为该文共同通讯作者。
本钻研得到了国度沉点研发打算、中科院战术先导专项、GA黄金甲信息化专项等项主张支持,GSA归档数据使用的推算机硬件设施得到国度财政部建理购置专项的持久支持。

GSA Family数据模型
论文链接






