学习中心
学习中心
声音克隆技术能够通过分析目标角色的声音,生成与之相似的语音,提供个性化的内容呈现方式,基于 AI 的声音克隆技术,允许用户选择个性化的声音进行文字的转述。声音克隆技术在个性化语音助手、虚拟主播、有声读物、影视后期制作和安全领域领域展现出广泛的应用前景。
在这一领域,飞影数字人团队已成功推出“声音克隆”基础版本,上线之后,凭借稳定且优异的发挥,得到了许多用户青睐。但是,在此基础上,飞影团队秉承着“精益求精”的态度,针对用户的使用反馈,做了进一步的细节优化,推出了“声音克隆”流畅版!
先以大家耳熟能详的《让子弹飞》中的一句台词看看效果:左边是原台词,右边是用飞影克隆出的声音。是不是已经很难分辨了?
其实,基础款已经在语音质量上均取得了不俗的成果,能够稳定生成自然、清晰且连贯的语音输出。基础款的语音合成技术在模仿真实人声方面做得非常到位,无论是在语调的起伏、节奏的把握,还是在情感的表达上,都显得十分自然。听众在聆听二者生成的语音时,也几乎感觉不到与真人发声的明显差异,在应对日常需求方面已绰绰有余。那么,流畅版又在哪些地方做了改进?和基础版相比又有哪些优势呢? 我们今天就来深扒一下。
★ 更加清晰的语言表述:
基础版在部分词语上存在语速连读过快的问题,导致用户听觉识别上可能存在问题。有部分字眼上会产生“吞音”,即不能完整且饱满的读出整个字的完整音节,直接影响了语音的清晰度和可理解性,使得听众在理解内容时可能会感到困难。而在流畅版中,对这一问题进行优化,在保证每个字发音标准基础上,满足听众“沉浸式”的听觉体验。
例: 今天是 12 月 21 日,星期六。冬至,如约而至,在最长的夜,期待一场温暖,愿来年,如初生的朝阳,温暖每个梦想,照亮前行的路。
基础版生成的音频文件中,对部分字的朗读(如:文本中的“月”“暖”两字)在发音上存在吞音,模糊不清的情况。这导致语音的清晰度和可理解性变低。一些不在意字幕,只听声音的听众在理解内容时可能会感到困难而带来误解。而流畅版中的每个音都能饱满圆润,清晰标准地发出。
下面展示一段更加“极端”的例子:
例: 刀,怒斩雪翼雕。 山,豪迈冲云霄。火,翻腾在燃烧。 海,掀起万丈高...
基础版模型在生成语音时,往往会出现一些不和谐的跳动音节,这些不协调的元素会打断听者的注意力,降低语音的自然度和舒适度。从这个例子中可以看出:基础版在每个短句上出现不和谐的气流杂音。只能依靠后期删去,而流畅版则完美规避了这一问题。流畅版面对不同特点任务时泛用性普适性更加强大,能够更加准确的判断语言信息,生成自然流畅的音频。
★ 更加准确的节奏把控:
基础版在模仿真实人声时也存在一定的局限性,它在语调的起伏和节奏的把握上不如流畅版自然,有时甚至会出现生硬的断句和明显的节奏变化,这些都会使得语音听起来不够流畅,缺乏真实感。流畅版可以较为精确地按照文本内容进行调整,确保了语音输出的一致性和可理解性。此外,流畅版在处理复杂的语音场景,如连续的语流、快速的语速变化或是情感丰富的表达时,都能够保持稳定的表现,不会出现突兀的跳跃或不自然的停顿,这进一步增强了其语音输出的流畅性和舒适度。
话不多说,上案例:
例: 去理发店呀,一定不要去大店。大店都是学徒,小店才是师傅。买肉先付钱,只要这么多。买茶、送礼的,要强调自己喝。亲戚朋友,请客聚会,没人通知,你就装作不知道,更不要去打听。
不难听出,基础版中出现了“···小店才是 | 师傅买肉···”此类出现不合逻辑的停顿,且在文本转化时无法通过“插入停顿来”来改变默认存在的停顿,一般看来只能通过复杂的剪辑工作消除停顿。无疑带来了巨大工作量。再来听听流畅版的效果。而在流畅版中,断句与节奏把控更加符合场景逻辑,正确输出文本信息。
★ 更加普适的使用场景:
基础版的声音克隆,对场景需求可能比较“严苛”,适合于类似“新闻播报”等标准的发声场景。在需要表达复杂情感或细微语调变化的场景中,基础版的表现往往不尽人意,无法准确传达文本中的情感色彩(如方言对话,以及情感色彩强烈的情景)影响了整体的听感体验。针对这一问题,团队在流畅版中进行了优化,使得流畅版能够满足不同的环境氛围下的声音需求:
例 你知道冬天吃对沙糖桔,对静脉曲张有多友好吗?家里吃剩下的大葱,你不要丢,它就是静脉曲张的劲敌。每天二两花生米,静脉曲张不找你。香蕉加苦瓜,静脉曲张回老家。黄豆加啤酒,静脉曲张说要走。
这是一段略带地区方言特点的语音,基础版与流畅版的差距更加明显。基础版在“知道”一次出现“吞音”现象,而流畅版清晰度则更高。且基础版在断句上识别错误(“你知道 | 冬天吃对 | 砂糖橘 | 对静脉曲张 | 有多友好吗?”识别为:“你知道冬天吃 | 对砂糖橘对 | 静脉曲张 | 有多友好吗?”)。由此看出,面对大量具有情感或是方言特色的语音生成任务,流畅版具有更强的泛用性。
例: 属兔的你要做好准备,好事和喜事啊,会一件接一件的到你家。这个时候啊,我要提醒你,收纳住自己,按捺住自己,别得瑟,祝你开心。
在这段文字中,基础版和流畅版对“得瑟”一次发音不同。得瑟是汉语方言词语,拼音是 dè se。基础版发音为汉字标准发音 dé se,而流畅版可以根据语音信息匹配合适的方言特点,准确发出方言的读法。而且整体看来流畅版断句以及节奏把控更加干脆果断,流畅版稍显“浑浊”。
综上所述,流畅版在语音质量上的优势明显,能够提供更加自然、清晰和流畅的语音输出,而基础版则在这些方面存在稍许的不足。说一千道一万,不如直接来飞影数字人声音克隆频道,亲身上手体验下吧!