时间:2026-08-19访问:1来源:历史铺

百度深度语音文本阅读系统释放潜能,让机器秒懂“说” 近期科技媒体《麻省理工科技评论》公布了百度研发的深度语音文本阅读系统最新研究成果。据报道,该系统在实现“说话”这一核心功能时,大大节省了幕后精调的工作量,仅需几小时就能掌握“说话”,完全无需人类干预。 百度方面向澎湃新闻确认了其在深度学习领域的这一最新成果。此前,导航、语音闹钟、手机接听等语音合成应用依赖文本转语音系统,而实际实现该功能需要记录大量人的语音数据生成新句子,每修改或重音变化都需重新录音并生成新数据库,这对机器来说无疑增加了精调工作的难度和成本。 百度运用深度学习技术将文本分割为最小单位生成“现象”(phenomes),随后再通过语音合成网络进行重新生成。这一独特的技术特点在于深度学习可以独立完成训练过程,无需人工微调,而谷歌DeepMind去年推出的WaveNet也已展示出类似的效果——在培训阶段仍需微调,且需要大量计算资源。 《麻省理工科技评论》以单词“Hello”介绍了百度深度语音合成技术的实现方式。百度系统会将“Hello”分割为以下“现象”(无声HH、HH
EH、EH
L、L
OW、OW
无声):
(无声,
HH)、(HH,
EH)、(EH,
L)、(L,
OW)、(OW,
无声)。这些“现象”随后通过语音合成系统转化为可被人类理解的单词。 然而,百度研发的深度语音文本阅读系统的实现需大量计算资源。真实语音采集码率为48赫兹,电脑生成样本时间仅为20微秒,但语音合成过程涉及多个关键层面,每个层面的任务都需要在1.5微秒内完成。对此,百度研究员表示:“要执行实时对接,我们必须保证不能重复计算任何结果,将整个处理模型存储在缓存之中(不是主内存),然后优化利用可用的计算单元。” 据悉,百度深度语言合成系统在亚马逊的Mechanical
Turk上进行了众包理解测试,结果显示其生成音频质量极高。百度表示,百度深度语音合成速度比实时快得多,能够应用于直播场景中,极大地提升了文本转语音系统的通用性。 该系统的实现路径也表明,未来百度将继续深化控制重音、持续时间和自然声音频率等研究方向,以实现改变输出的语音和词语中所传达的情感功能。深度学习作为机器学习的一个重要分支,其通过多层次的学习得到不同抽象层的表示,在百度系统中已展现出强大的应用潜力,有望在更多领域带来突破性进展
。