一种基于深度学习的DNA序列基元挖掘方法和系统
2022-06-05 14:06:10
跟着技巧的无间繁荣,越来越众的磋商职员操纵高通量实习本领来对生物体内基因组序列中或许与卵白质爆发绑定的位点举办长远磋商。目前比拟成熟的用于磋商转录因子正在体内绑定效率的实习本领有以下几种:chip-chip、chip-seq以及迩来提出的chip-exo。磋商职员操纵上述实习本领正在基因组内对已有的数百万条序列举办精准定位,从而得回基因组内可能与卵白质爆发绑定效率的短序列区域的干系数据。通过上述实习数据,磋商职员能够正在全基因组领域内对众种卵白质正在区别结构细胞中的绑定性情举办长远磋商,从而助助人们进一步搜求生物体内区别卵白质间的彼此效率性情。
跟着高通量测序技巧的敏捷繁荣,仍旧提出了众种实习本领来提取体内(in-vivo)和体外(in-vitro)的绑定区域。特地地,chip-seq和高通量测序大大加众了体内可用数据量,这将有利于体内卵白质与基因组序列绑定的磋商。另一方面,卵白质连系微阵列(pbm)能够衡量转录因子与给定长度k的全体或许的dna序列变体的体外连系,这为直接拓荒绑定位点预测模子供应了极好的新闻来历。随后就络续显现了百般处分高通量数据的算法,比方针对chip-seq数据的dreme、bioprospector和motifrg等本领;针对pbm数据的herdclustering和rankmotif++;针对ht-selex数据的toivonen和htsibis等本领,以及能够归纳同一处分这些数据的dimont算法等。然而,采用守旧的本领处分云云大范畴的数据会受到相当大的束缚,比方,容错机能低、对噪声敏锐、泛化才智差,年光丰富度高。跟着盘算机外面以及技巧的无间繁荣,深度研习仍旧被告成地运用于百般大数据磋商范围中。磋商者动手考试操纵深度神经收集等丰富机械研习模子来发现绑定位点基元新闻,以及明白卵白质绑定与基因变异之间的相闭干系。deepbind是首个将深度卷积神经收集运用于绑定位点预测的基元发现算法,从集成现有纯洁绑定模子的角度对守旧的深度研习本领举办了调度,策画了一种基于深度卷积神经收集的转录因子绑定模子。用户能够将众种高通量技巧出现的高通量数据(比方:chip-seq,pbm,ht-selex)动作原始数据输入到deepbind模子中,然后deepbind能够操纵自身订定的端正归纳商量众种数据,并从中研习出转录因子绑定偏好的模子参数。
然而现有的基元发现本领紧要是基于守旧机械研习和深度研习的本领,越来越众的证据注脚基于守旧机械研习的本领无法处分大范畴测序数据,泛化才智差,且极端耗时,而基于深度研习的本领能很好地缓解或制胜守旧本领的亏空。然而,基于深度研习的本领还存正在以下题目:1)服从齐备监视的研习框架,而纰漏了基因组序列的弱监视新闻,即一段dna序列或许包罗众个转录因子连系位点;2)操纵独热(one-hot)编码,而该编码办法纰漏了核苷酸之间的依赖性;3)仅采用cnn来研习dna序列的空间新闻,而纰漏了序列特质之间的历久依赖干系。
举措1、采用重叠盘据计谋对获取的每条dna序列处分成一个数据包,采用k-met编码对数据包里的每一个示例举办编码;
动作优选,举措1中所述重叠盘据计谋为:界说一个长度为c的滑动窗口,并通过步幅s将长度为1的dna序列分成众个长度为c的示例,将一条dna序列转换为一个数据包,所述数据包中的示例数目为(l-c)/s+1,此中,s和c为预设超参数。
动作优选,举措1中采用k-mcr编码将全体的示例转换为具有高阶依赖干系的图像矩阵,盘算进程如下公式所示:
此中,i∈[1,c-k+1],j∈[1,4k],c外现示例的长度,k外现编码的阶数,xi外现来自{a,c,g,t}的任一字符,而xi,j外现进程k-mer编码后的一个矩阵。此中,当k被修树为1时,k-mer编码就等价于one-hot编码。
动作优选,举措2中所述混淆深度神经收集模子蕴涵:卷积神经收集和递归神经收集。此中卷积神经收集(cnn)采用权重共享计谋来缉捕dna序列中的局限形式,而递归神经收集(rnn)操纵其内部形态来研习动态年光或序列形式;cnn被用于研习基元特质,而rnn被用于研习基元特质之间的历久依赖干系。
动作优选,举措2中运用该混淆深度神经收集模子对每个数据包中的全体示例举办预测打分,获得了每个示例的打分值p,其为示例包罗连系位点的概率。
此中,pij外现第i个数据包中第j个示例的得分,ni外现第i个数据包中的示例数目,外现第i个数据包的均匀得分,noisy-and被策画为当示例的均匀值胜过预设阈值时激活一个数据包概率pi,a为预设超参数,用于负责noisy-and的斜率,bi外现每个数据包i的自适宜软阈值,σ(a(1-bi))和σ(-abi)用于归一化pi到[0,1],bi局限正在[0,1]以及a>0,σ外现sigmoid函数。
通过noisy-and本领将数据包中全体示例的预测值举办调和,以此来获得该数据包“绑定”和“非绑定”的概率散布。
预处分装备:用于采用重叠盘据计谋对获取的每条dna序列处分成一个数据包,采用k-met编码对数据包里的每一个示例举办编码;
打分装备:用于对每个数据包举办特质研习,以构制混淆深度神经收集模子,对数据包中每个示例举办预测打分;
本发现的技巧计划,采用弱监视研习框架,即将众示例研习与深度研习举办调和,用于发现dna序列的弱监视新闻;采用k-met编码来预处分dna序列,用于编码核苷酸之间的依赖性;采用构制卷积、递归混淆神经收集模子,此中,cnn用于研习dna序列的空间新闻,而rnn用于研习序列特质之间的历久依赖干系。
举措1、对获取的dna序列举办预处分,采用重叠盘据计谋将每条dna序列处分成一个数据包,采用k-met编码对数据包里的每一个示例举办编码;
商量到dna序列的弱监视新闻,本实例采用mil的观点来处分dna序列。采用重叠盘据计谋将dna序列分成众个示例,如此能够确保:1)保存了dna序列内正在的弱监视新闻;2)天生了豪爽的包罗绑定位点的示例。重叠盘据计谋界说为一个长度为c的滑动窗口,并通过步幅s将长度为1的dna序列分成众个长度为c的示例。所以能够将一条dna序列转换为一个数据包,这个数据包中的示例数目为(l-c)/s+1,此中,s和c为预设超参数;假如(l-c)不是s的倍数,将正在dna序列的末尾增加“零”以确保它们能够被整除。
盘据dna序列后,全体的示例都须要被转换为矩阵输入,以便后续深度神经收集模子操纵。one-hot编码为基于深度研习的基元发现本领中最常用的编码本领,其假设核苷酸之间是彼此独立的,但现实中核苷酸之间存正在必定的高阶依赖干系。所以,为了缓解这一题目,本实例操纵k-mer编码将全体的示例转换为具有高阶依赖干系的图像矩阵,盘算进程如下公式所示:
此中,i∈[1,c-k+1],j∈[1,4k],c外现示例的长度,k外现编码的阶数,xi外现来自{a,c,g,t}的任一字符,而xi,j外现进程k-mer编码后的一个矩阵。遵循上述公式,当k被修树为1时,k-mer编码就等价于one-hot编码。比方,1-mer编码:每个独立的核苷酸被映照到巨细为4的向量(a→[1,0,0,0]t,c→[0,1,0,0]t,g→[0,0,1,0]t和t→[0,0,0,1]t);2-mer编码:商量到两个相邻核苷酸之间的依赖干系,每个二核苷酸(2-mer)被映照到巨细为16的向量(aa→[1,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0]t,…,tt→[0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,1]t);3-met编码:商量到三个相邻核苷酸之间的依赖干系,每个三核苷酸(3-met)被映照到巨细为64的向量(aaa→[1,0,0,0,…,0,0,0,0,0],…,ttt→[0,0,0,0,…,0,0,0,0,1])。
正在简直完毕中,开始通过k-met编码将每个示例编码成巨细为1×4k×1×(c-k+1)的张量(批量巨细×通道数×高度×宽度),然后沿着高度维度将数据包中全体示例联贯成一个张量。所以,一个数据包能够用巨细为1×4k×n×(c-k+1)的张量来外现,n是每个数据包的示例数目(n=(l-c)/s+1)。
进一步地,举措2简直为:商量到dna序列的空间和序列性情,本执行例采用混淆的深度神经收集模子,该模子集成卷积和递归神经收集。此中,卷积神经收集(cnn)采用权重共享计谋来缉捕dna序列中的局限形式,而递归神经收集(rnn)能够操纵其内部形态(存储器)来研习动态年光或序列形式。正在策画的模子中,cnn被用于研习基元特质,而rnn被用于研习基元特质之间的历久依赖干系。该模子按以下程序举办构修:卷积层→最大池化层→损失层(dropout)→递归层→损失层→softmax层。模子中所采用的层的效率和修树陈说如下:
卷积层:用于研习dna序列的基元特质,用来盘算全体潜正在绑定位点的分数,后面接一个relu非线性层。已有早期劳动研讨了cnn操纵区别数目的卷积核时的机能,并挖掘操纵更众的卷积核能够明显进步模子的机能。所以正在本执行例中,没有再去议论卷积核的数目关于模子机能的影响,而是直接将其修树为固定值16。
最大池化层:deepbind操纵了整体最大池化层从一切dna序列当选出反响最大的片断,而本发现策画的模子操纵了池化巨细为(1,8)的最大池化层来记实一切序列的局限最好值。
损失层(dropout):dropout计谋为操纵的正则化技巧,通过防范数据的丰富协同适宜来裁减深度神经收集中的太甚拟合,其以概率p随机地将前一层的输出修树为零。概率p是一个超参数,能够通过交叉验证明验举办选择。
双向递归层:用于缉捕基元特质之间的前向和后向历久依赖干系,它由是非期存储器(longshort-termmemory,lstm单位构成。lstm单位广泛由形态存储单位、输初学、遗忘门和输出门构成,此中形态存储单位能够正在轻易年光间隔记实形态值,而且3个门能够负责流入和流出形态存储单位的新闻流。本执行例没有正在递归层后接全联贯层,由于这会消浸模子的机能。该层中的正向和反向划分修树了32个lstm单位,所以该层总共有64个lstm单位。
softmax层:用于盘算正在绑定或非绑定序列上的概率散布,它由2个神经元构成,每个神经元与前一层稠密联贯并盘算对应的概率。
运用该混淆深度神经收集模子对每个数据包中的全体示例举办预测打分,获得了每个示例的打分值p,其为示例包罗连系位点的概率。
将众示例研习与深度研习举办调和,用于发现dna序列的弱监视新闻,众示例研习(mil)广泛基于以下假设,即假如数据包中起码存正在一个正示例(包罗绑定位点)则该数据包被象征为正,假如数据包中不含任何的正示例则该数据包被象征为负。所以,取最大值(max)就常被用作mil中的调和函数,但max只选择新闻量最大的示例而纰漏了其它或许包罗有效新闻的示例。正在本执行例中,采用一种更好、更通用的调和本领noisy-and,该本领基于一个更为合理的假设,即假如数据包中正示例的数目胜过一个阈值则才会被象征为正,这种设定能够正在必定水准上裁减假阳性样本的作梗。noisy-and盘算进程如下公式所示:
此中,pij外现第i个数据包中第j个示例的得分,ni外现第i个数据包中的示例数目,外现第i个数据包的均匀得分。noisy-and被策画为当示例的均匀值胜过预设阈值就激活一个数据包概率pi,a为预设超参数,用于负责noisy-and的斜率。bi外现每个数据包i的自适宜软阈值,而且能够通过演练无间优化,σ(a(1-bi))和σ(-abi)被用于归一化pi到[0,1],bi局限正在[0,1]以及a>0,σ指sigmoid函数。
通过该调和函数,能够将数据包中全体示例的预测值举办调和,以此来获得该包“绑定”和“非绑定”的概率散布。
综上所述,本发现本领蕴涵以下几个阶段:数据预处分阶段(盘据、k-mer编码)→模子策画阶段(卷积层→最大池化层→损失层(dropout)→递归层→损失层→softmax层)→调和阶段(noisy-and函数)。采用弱监视研习框架,即将众示例研习与深度研习举办调和,用于发现dna序列的弱监视新闻;采用k-mer编码来预处分dna序列,用于编码核苷酸之间的依赖性;采用构制卷积、递归混淆神经收集模子,此中,cnn用于研习dna序列的空间新闻,而rnn用于研习序列特质之间的历久依赖干系。
如图2所示,本发现还供应一种基于深度研习的dna序列基元发现体例,完毕上述dna序列基元发现本领,其蕴涵:
预处分装备:用于获取的dna序列举办预处分,采用重叠盘据计谋将每条dna序列处分成一个数据包,采用k-mer编码对数据包里的每一个示例举办编码;
打分装备:用于对每个数据包举办特质研习,以构制混淆深度神经收集模子,对数据包中每个示例举办预测打分;
正在上述执行例中,能够统共或片面地通过软件、硬件、固件或者其轻易组合来完毕。当操纵软件完毕时,能够统共或片面地以盘算机标准产物的体式完毕。所述盘算机标准产物蕴涵一个或众个盘算机指令。正在盘算机加载和履行所述盘算机标准指令时,统共或片面地出现遵循本申请执行例所述的流程或功用。所述盘算性能够是通用盘算机、专用盘算机、盘算机收集、获取其他可编程装备。所述盘算机指令能够存储正在盘算机可读介质中,或者从一个盘算机可读介质向另一个盘算机可读介质传输,比方,所述盘算机指令能够从一个网站站点、盘算机、任事器或数据核心通过有线(例坊镳轴电缆、光纤、数字用户线(dsl))或无线(比方红外、无线、微波等)办法向另一个网站站点、盘算机、任事器或数据核心举办传输。所述盘算机可读介质能够是盘算机可能存取的任何可用介质或者是包罗一个或众个可用介质集成的任事器、数据核心等数据存储修造。所述可用介质能够是磁性介质(比方,软盘、硬盘、磁带)、光介质(比方,dvd)、或者半导体介质(比方固态硬盘solidstatedisk(ssd))等。
专业职员应当还能够进一步认识到,连系本发现中所公然的执行例描绘的各示例的单位及算法举措,可能以电子硬件、盘算机软件或者二者的连系来完毕,为了通晓地评释硬件和软件的可相易性,正在上述评释中仍旧遵循功用通常性地描绘了各示例的构成及举措。这些功用到底以硬件照样软件办法来履行,取决于技巧计划的特定运用和策画拘束前提。专业技巧职员能够对每个特定的运用来操纵区别本领来完毕所描绘的功用,然而这种完毕不应以为超过本申请的领域。
本范围寻常技巧职员能够剖释完毕上述执行例本领中的统共或片面举措是能够通进程序来指令处分器实现,所述的标准能够存储于盘算机可读介质中,所述存储介质诟谇短暂性(英文:non-transitory)介质,比方随机存取存储器、只读存储器、疾闪存储器、硬盘、固态硬盘、磁带(英文:magnetictape)、软盘(英文:floppydisk)、光盘(英文:opticaldisc)及其轻易组合。
以上所述,仅为本申请较佳的简直执行办法,但本申请的珍爱领域并不部分于此,任何熟谙本技巧范围的技巧职员正在本申请揭发的技巧领域内,可容易念到的转化或替代,都应涵盖正在本申请的珍爱领域之内。所以,本申请的珍爱领域应当以权益请求的珍爱领域为准。