添加链接
link之家
链接快照平台
  • 输入网页链接,自动生成快照
  • 标签化管理网页链接

原标题:谷歌宣布开源Live Transcribe语音识别转文字工具

8月18日,Google宣布开源Android语音识别转录工具Live Transcribe的语音引擎。它可以将语音或对话实时转录为文字,还能够为听障人士提供帮助。

利用云端技术

Live Transcribe 是谷歌于今年2月推出的一款Android应用程序,它的语音识别由谷歌最先进的Cloud Speech API提供。但是,依赖于云引入了一些复杂性,不断变化的网络连接、数据成本和延迟等等都带来一些考验。因此,谷歌把它开源出来,希望开发人员在已有的基础上进一步构建和开发。

Google的Cloud Speech API目前不支持发送无限长的音频流。此外,依赖云意味着网络连接、数据成本和延迟方面都有潜在问题。在会话之间,语音引擎还在本地缓冲音频,然后在重新连接时发送它。因此,Google避免了截断的句子或单词,并减少了会话中丢失的文本量。

为了降低带宽需求和成本,Google还评估了不同的音频编解码器:FLAC,AMR-WB和Opus。FLAC(无损编解码器)可以保持准确性,不会节省太多数据,并且具有明显的编解码器延迟。AMR-WB可以节省大量数据,但在嘈杂的环境中准确度较低。与此同时,Opus允许数据速率比大多数音乐流媒体服务低许多倍,同时仍保留音频信号的重要细节。

Google还会在长时间的静音期间使用语音检测来关闭网络连接。总体而言,该团队能够实现“在不影响准确性的情况下,将数据使用量减少10倍”。为了比Cloud Speech API更进一步减少延迟,Live Transcribe使用自定义Opus编码器。编码器恰好提高了比特率,使“延迟在视觉上无法区分发送未压缩的音频”。

阿里最新AI语音技术

不只是谷歌,国内互联网三大巨头之一的阿里在AI语音技术方面也有较快发展。今年7月,阿里巴巴发布新一代语音合成技术KAN-TTS,称可大幅提高合成语音与真人发声的相似度,并将语音合成定制成本降低10倍以上。该技术由达摩院机器智能实验室自主研发。 阿里方面称,当前业界商用系统的合成语音与原始音频录音的接近程度通常在85%到90%之间,而基于KAN-TTS技术的合成语音可将该数据提高到97%以上。

据悉,KAN-TTS由达摩院机器智能实验室自主研发,深度融合了目前主流的端到端TTS技术和传统TTS技术,从多个方面改进了语音合成。传统语音合成定制需要10小时以上的数据录制和标注,对录音人和录音环境要求很高。从启动定制到最终交付,项目周期长成本高。

阿里利用Multi-Speaker Model与Speaker-aware Advanced Transfer Learning相结合的方法,将语音合成定制成本降低10倍以上,周期压缩3倍以上。也就是说,用1小时有效录音数据和不到两个月制作周期,就能完成一次标准TTS定制。此外,这使得普通用户定制“AI声音”的门槛更低。只需手机录音十分钟,就能获得与录制声音高度相似的合成语音。

AI语音公司造芯运动

技术的不断更新,相关领域的企业也在不断加快布局。从2018年开始,AI语音公司不约而同地开始了一波新造芯运动。云知声发布了面向AIoT市场的UniOne芯片,出门问问发布了AI语音芯片模组“问芯”Mobvoi A1,Rokid发布了AI语音芯片KAMINO18。2019年1月2日,云知声再次发布正在研发中的三款定位不同场景的AI芯片。两天后,思必驰也推出了AI语音芯片深聪TAIHANG芯片。

从目前头部几家公司来看,做AI语音芯片的思路还是选择和有经验的芯片公司深度合作。比如思必驰选择中芯国际,共同注资成立上海深聪半导体有限责任公司;Rokid宣布自己的芯片是基于杭州国芯科技的芯片深度定制;猎豹移动旗下猎户星空选择和瑞芯微电子合作。从开发周期和成本的角度来看,比较成熟的芯片公司已经有积累,很多东西不需要重新去设计,因此联合研发能够缩短开发周期。

一般来说,语音公司做AI芯片的思路无外乎两种:一种是和自己的解决方案搭配出售,另外一种则是直接对外卖硬件。虽然AI语音芯片也被认为是AI语音技术落地的一种方式,一定程度上缓解了落地焦虑,但对于AI语音公司们来说,AI芯片所考验的不仅仅是技术能力,还有商业化落地能力以及风险承担能力。 返回搜狐,查看更多

责任编辑:

声明:该文观点仅代表作者本人,搜狐号系信息发布平台,搜狐仅提供信息存储空间服务。