百度研究出深度学习语音识别系统DeepSpeech嘈杂环境下识别率超Google

2022-03-09 22:34:05

  不久前,百度的首席科学家吴恩达(Andrew Ng)正在接收采访时曾叙到了百度近来人工智能项方针发达情景,夸大了近期百度中心是攻合语音识别。现正在他们一经正在这方面获得了冲破。

  这项成就的名字叫做Deep Speech,是一款采用深度研习技能的语音识别编制编制。其特殊之处正在于,它可能正在饭馆等嘈杂境遇下实行快要81%的辨识凿凿率。

  81%的凿凿率听起来好像不算高。然则同样境遇下,其他的贸易版语音识别API,搜罗Bing、Google以及Wit.AI等的最高识别率也惟有65%。比拟之下这就算特别越过的阐扬了。并且根据吴恩达的说法,云云的结果已经低估了Deep Speech与其他语音识别编制的凿凿率差别,由于Deep Speech举办对照时还把其他语音识别编制那些返回空缺字符串的结果排斥正在外了。并且Deep Speech跟顶级的学术型语音识别模子(基于时髦的数据集Hub5 00修模)比拟也越过9个百分点。

  百度首席科学家吴恩达称纵然这还只是一项讨论,然则公司正正在思虑将它集成到供智在行机和Baidu Eye之类的可穿着摆设利用的语音识别软件当中。并且百度还正在开垦与Amazon Echo肖似、集成有语音助手的家电产物,名字叫做CoolBox。除此以外,百度正在开垦的智能自行车当然也能使用Deep Speech技能。

  Deep Speech的根柢是某种递归神经汇集(RNN),这种递归神经汇集常常被用于语音识别和文本说明。

  然则Deep Speech的凯旋要紧得益于一个长达10万小时的语音数据磨练集。这是百度人工智能测验室团队用新奇的举措正在嘈杂境遇下创设的。其经过大致是云云的。起初百度网罗了7000小时的语音会话数据,然后再将这些语音文献与包罗有布景噪音的文献合成到一同,末了变成约10万小时的磨练集。这些布景噪音搜罗了饭馆、电视、自助餐厅以及汽车内、火车内等场景。比拟之下,Hub5 00的数据集总共惟有2300小时。

  当然,这么广大的数据大大批编制都不晓畅怎样行止理。吴恩达透露,Deep Speech的凯旋很大水准上要取决于百度范围广大的基于GPU的深度研习根柢措施。GPU(图形措置器)往往是偏数学型打算的首选。很众深度研习编制都采用GPU避免通讯瓶颈(不外微软的深度研习编制Adam 却走了区别的门途),然则像百度云云大范围的措施却是少睹的。

  百度的另一大改正,是对这个广大的数据集采用了端到端的深度研习模子,而不是模范的、打算价钱兴奋的声学模子。守旧上寻常城市把语音识别分散为众个环节,此中一步叫做语腔调适,然则百度却不做这一步,而是给Deep Speech的算法供给大批的数据,然后让它去研习悉数须要研习的东西。这种做法除了劳绩了凿凿率以外,还明显省略了代码库的范围。

  这项讨论是吴恩达向导的百度人工智能测验室众位讨论职员的勤苦成就,论文公布正在了康奈尔大学藏书楼的站上,感意思的可到此处下载。