6 篇Science 齐发首次破译完整的人类基因组百人科学家团队揭开背后的神秘面

2022-04-05 08:25:51

  原题目:6 篇Science 齐发,初度破译无缺的人类基因组,百人科学家团队揭开背后的奥秘面纱

  自 2000 年头度颁布今后,人类参考基因组仅涵盖基因组的常染色质一面,而苛重的异染色质区域尚未杀青。

  2022年3月31日,端粒到端粒 (T2T) 同盟正在Science正在线揭晓题为“The complete sequence of a human genome”的查究论文(该作品入选为Science封面作品),该查究针对盈余 8% 的基因组,供给了人类基因组的无缺 30.55 亿碱基对序列 T2T-CHM13,此中包罗除 Y 之外的悉数染色体的无间隙装置,改正了之前的参考序列,并先容了近 2 亿个碱基对序列,此中蕴涵 1956 个基因预测,此中 99 个预测为卵白质编码。杀青的区域包罗悉数着丝粒卫星阵列、近来的节段反复和悉数五个近端着丝粒染色体的短臂。

  总之,与过去 20 年的任何基因组参考版本比拟,T2T-CHM13 拼装添补了五个无缺的染色体臂和更众的卓殊序列。这 8% 的基因组并没有由于缺乏苛重性而被疏漏,而是由于身手范围。高精度长读长测序结果打消了这一身手困难,可以对一切人类基因组的基因组变异举行周密查究,估计这将鞭策人类基因组健壮和疾病的改日呈现。

  2022年4月1日,华盛顿大学Mitchell R. Vollger等人正在Science正在线揭晓题为“Segmental duplications and their variation in a complete human genome”的查究论文,该查究运用无缺的端粒到端粒人类基因组 (T2T-CHM13),供给了人类片断反复 (SD)构制的周密视图。SD 占卓殊序列的近三分之一,将全基因组揣摸从 5.4% 添补到 7.0% [2.18 亿碱基对 (Mbp)]。对 268 部分类基因组的了解阐明,91% 的先前未解析的 T2T-CHM13 SD 序列 (68.3 Mbp) 更好地代外了人类拷贝数变异。较量来自人类 (n = 12) 和非人类灵长类动物 (n = 5) 基因组的长读长拼装,该查究体例地重修了生物医学相干和反复基因的进化和构造单倍型众样性。该了解揭示了人类与其他灵长类动物之间 SD 构制构造杂合性和进化分别的形式。

  2022年4月1日,加州大学伯克利分校Nicolas Altemose等人正在Science正在线揭晓题为“Complete genomic and epigenetic maps of human centromeres”的查究论文,一个无缺的端粒到端粒人类基因组拼装 (T2T-CHM13) 使查究职员可以周密地外征组成基因组 6.2% 的着丝粒界限和着丝粒反复序列(189.9 兆碱基)。这些区域的仔细图谱显示了众碱基构造重排,包罗活性着丝粒反复阵列。对着丝粒相干序列的了解揭示了着丝粒的场所与界限 DNA 通过分层反复扩展的进化之间的亲密相干。其余,对差异个别组中 X 染色体着丝粒的较量揭示了这些繁杂且急迅进化的区域中高度的构造、外观遗传和序列变异。

  2022年4月1日,康涅狄格大学Savannah J. Hoyt等人正在Science正在线揭晓题为“From telomere to telomere: The tranional and epigenetic state of human repeat elements”的查究论文,该查究提出了 T2T-CHM13 人类参考基因组的重新反复呈现和评释。该查究确定了以前未知的卫星阵列,扩展了反复和挪动元件的变体和家族目次,外征了繁杂复合反复的种别,并定位了逆转录转导变乱。该查究检测了再生转录并形容了 CpG 甲基化谱,以界说人类转录活性逆转录元件的构造,包罗着丝粒中的逆转录元件构造。这些数据扩展了对塑制人类基因组的反复区域的众样性、漫衍和进化的洞察力。

  暂时的人类参考基因组由基因组参考同盟 (GRC) 于 2013 年颁布,近来一次修补是正在 2019 年 (GRCh38.p13)。该参考基因组可追溯到人类基因组方针 ,而且正在过去的二十年中连续更始。与角逐的 Celera 和公共半基于“猎枪”序列拼装的新颖测序项目差异,GRC 拼装是由通过辐射沿人类基因组排序和定向的测序细菌人工染色体 (BAC) 构修的杂交、遗传连锁和指纹图谱。然而,BAC 克隆的范围性导致反复序列的代外性缺乏,而且来自众个个别的 BAC 的时机性拼装导致了单倍型的镶嵌。结果,几个 GRC 拼装间隙因为其侧面不兼容的构造众态性而无法处分,而且很众其他反复和众态性区域未杀青或拼装禁绝确。

  GRCh38 参考拼装蕴涵 151 兆碱基对 (Mbp) 的未知序列,漫衍正在一切基因组中,包罗着丝粒界限和亚端粒区域、扩增基因阵列和核糖体 DNA (rDNA) 阵列,悉数这些都是根本基因组细胞流程所必须的。少许最大的参考缺口包罗人类卫星(HSat)反复阵列和悉数五个近端着丝粒染色体的短臂,它们正在 GRCh38 中流露为未知碱基的众兆碱基延长。纵然人类基因组方针和 GRC 都杀青了抬高参考质料的竭力,但正在随后的几年中缩小盈余差异的进步有限。

  长读长鸟枪法测序治服了基于 BAC 的拼装的范围性,绕过了基因组之间构造众态性的寻事。PacBio 的众千碱基单分子读取被证据可以处分 GRCh38中的繁杂构造变异和间隙,而 Oxford Nanopore 的 100-kbp “超长”读数可以无缺拼装人类着丝粒(染色体 Y),然后是拼装一切染色体(染色体 X)。然而,这些身手的高纰谬率 (5%) 对长的、简直相通的反复阵列的拼装提出了寻事。PacBio 最新的“HiFi”轮回共有测序供给了 20-kbp 读取长度的折衷计划,纰谬率为 0.1%。

  为了杀青基因组的结尾盈余区域,该查究诈骗 PacBio HiFi 和 Oxford Nanopore 超长读长测序的互补方面来拼装一律的纯合 CHM13hTERT 细胞系(以下简称 CHM13)。由此发作的 T2T-CHM13 参考拼装打消了一个 20 年前的樊篱,该樊篱障翳了基于序列的了解的 8% 的基因组,包罗悉数着丝粒区域和五部分类染色体的一切短臂。正在这里,该查究刻画了一个真正无缺的人类参考基因组的构修、验证和发轫了解,并争论了它对该范围的潜正在影响。

  该查究针对盈余 8% 的基因组,供给了人类基因组的无缺 30.55 亿碱基对序列 T2T-CHM13,此中包罗除 Y 之外的悉数染色体的无间隙装置,改正了之前的参考序列,并先容了近 2 亿个碱基对序列,此中蕴涵 1956 个基因预测,此中 99 个预测为卵白质编码。杀青的区域包罗悉数着丝粒卫星阵列、近来的节段反复和悉数五个近端着丝粒染色体的短臂。

  总之,与过去 20 年的任何基因组参考版本比拟,T2T-CHM13 拼装添补了五个无缺的染色体臂和更众的卓殊序列。这 8% 的基因组并没有由于缺乏苛重性而被疏漏,而是由于身手范围。高精度长读长测序结果打消了这一身手困难,可以对一切人类基因组的基因组变异举行周密查究,估计这将鞭策人类基因组健壮和疾病的改日呈现。