韵律特征驱动的并行语音合成技术及应用

123技术园

首页 / 技术内容

韵律特征驱动的并行语音合成技术及应用

2025-01-19 16:17

No.1330573133601841152

技术概要

PDF全文

本技术方案涉及一种韵律特征驱动的并行语音合成技术及其相关装置、设备和介质，旨在提升语音合成技术的效果。该技术方案首先对目标语音文本进行正则化处理，随后并行地将正则化文本转换为合成语音，以实现高效且自然的语音输出。

背景技术

语音合成是指从文本中合成出可理解的、自然的语音，又称文本转语音(Text toSpeech,TTS)在人类通信中有着广泛的应用，一直是人工智能、自然语言和语音处理领域的热点研究课题。语音合成经历了三个发展阶段，分别是基于拼接的语音合成、基于统计参数的语音合成和基于神经网络的语音合成。随着深度学习的蓬勃发展，基于神经网络的语音合成得到了井喷式发展，语音合成的音质和自然流畅度都得到明显改善。目前基于神经网络的主流语音合成技术分为两类：自回归语音合成和非自回归语音合成。自回归语音合成的语音音质和流畅度高，但是由于其自回归结构导致合成速度较慢、鲁棒性较低，且会出现重复字和吞字的问题。目前，解决自回归语音合成慢的方法主要是通过将整句进行切片处理，从而达到并行的目的。但是，这种方法本质上还是自回归结构的语音合成，合成速度较慢，且没有从根本上避免鲁棒性低的问题。非自回归合成的速度较快且鲁棒性高，但是合成的语音音质和流畅度低。本专利从实用角度出发，提出了一种基于韵律特征的并行语音合成方法及装置、介质、设备。首先，将待合成语音文本正则化；其次，将所述正则化语音文本并行转换为音素序列和音素韵律序列；然后，将所述音素序列和所述音素韵律序列利用声学模型预测其梅尔频谱图；最后，将所述梅尔频谱图利用HiFi-GAN声码器转换为所述待合成语音文本的语音信号。本专利融自回归语音合成和非自回归语音合成的优势，不仅能有效提升语音合成的音质、流畅度、速度和鲁棒性，而且能实现实时的高效语音合成。基于本专利开发的系统可广泛应用于人工智能领域的智能化语音合成，如智能客服、智能音响、语音播报、地图导航和有声读物等人机交互场景。

实现思路

阅读余下40%

技术概要为部分技术内容，查看PDF获取完整资料

该技术已申请专利，如用于商业用途，请联系技术所有人！

技术研发人员：

王国强

技术所属：上海工程技术大学.

相关技术

一种维纳增益的设计方法  一种维纳增益的设计方法 
 本发明公开了一种维纳增益的设计方法，包括:进行维纳增益估计，将估计获得的维纳增益作为后置滤波器，所述维纳增益估计过程包括：根据波束形成器输出的输出信号进行信噪比估计，得到信噪比估计值；在噪声和混响环境下，根据信噪比估计值及由麦克风阵列采集的观测信号进行相干散射比估计，得到相干散射比估计值；根据信噪比估计值及相干散射比估计值进行增益估计，得到维纳增益。本发明综合考虑了CDR和SNR来设计维纳增益，大大提升了语音增强技术在语音降噪、失真度控制以及去混响能力等方面的性能。
基于FPGA的深海水声数据压缩方法与装置  基于FPGA的深海水声数据压缩方法与装置 
 本申请涉及声波数据处理技术领域，具体涉及基于FPGA的深海水声数据压缩方法与装置，该方法包括:根据深海水声数据模态分解得到IMF波的能量分布进行分段处理，得到各段声音数据；根据任意两段声音数据的振幅数值及变化的相似情况，得到声音相似性度量；根据所有不同IMF波上相同时间段的声音数据以及同一IMF波上不同声音数据的声音相似性度量，得到信息浓度；根据信息浓度选取小波变换过程中的小波基函数组，对所有IMF波小波变化后的小波系数进行量化后编码，得到深海水声数据的压缩结果。本申请可提高深海水声数据的压缩质量。
一种自适应感知的一维离散时间信号活动检测方法和系统  一种自适应感知的一维离散时间信号活动检测方法和系统 
 本发明提供了一种自适应感知的一维离散时间信号活动检测方法和系统，首先通过预加重补偿一维离散时间信号的频谱衰减，然后将预加重后的一维时间信号流按固定长度分成多个短的时间帧，接着对帧信号进行加窗处理，随后计算单帧信号的短时能量积分，并进行动态能量阈值调整，阈值调整包括自适应跟随阈值调整和后级识别神经网络辅助调整，调整后得到一个当前的能量阈值，在得到的当前能量阈值的基础上加上一个常数作为判决阈值，最后采用判决阈值进行信号活动检测，得到信号帧实时的分类结果。通过动态的能量阈值调整，使得最后的能量阈值跟随在信号幅值附近，达到了自适应环境的目的，大大提高了信号活动检测的准确率，降低了设备功耗。
一种基于多域声学特征融合的说话人识别方法、装置及设备  一种基于多域声学特征融合的说话人识别方法、装置及设备 
 本发明涉及一种基于多域声学特征融合的说话人识别方法，包括以下步骤:获取待识别的语音数据；分别提取每个语音数据的频谱图和分数频谱图；将频谱图和分数频谱图经过滤波器组，分别得到第一Fbank特征和第二Fbank特征，并将第一Fbank特征和第二Fbank特征组合成声学特征；采用特征融合方法将声学特征融合；将融合后的声学特征输入说话人识别网络模型中，得到待识别说话人语音的声纹特征；根据待识别说话人语音的声纹特征，得到识别结果。本发明得到了高精度和高区分度的声纹特征，提高了说话人识别准确性。
一种语音转换的信息处理方法和系统  一种语音转换的信息处理方法和系统 
 本发明属于信息处理领域，本发明提供了一种语音转换的信息处理方法和系统，包括:基于所有收集语音数据的接口，获取所有需要语音转换的语音信号数据，进行降噪处理，得到初降噪语音信号；获取语音信号的基频和共振峰位置，分析处理得到性别特征值并将其进行划分；基于性别分类后的语音信息，获取语音信息的波形数据进行综合分析处理得到情绪特征值并分类处理；基于降噪处理后的语音信息，转换出语音信息对应的官方文字信息并将语音信息携带的性别和情绪信息附加在文字信息中；将语音转换后的官方语言文字转换成官方语音信息，并将语音信息携带的性别和情绪信息附加在转换后的语音信息中，提高人机交互的质量，改善人类日常生活和工作体验。
基于多尺度全局卷积网络的语音关键词识别方法及系统  基于多尺度全局卷积网络的语音关键词识别方法及系统 
 本发明公开了基于多尺度全局卷积网络的语音关键词识别方法及系统，涉及语音识别技术领域，包括以下步骤:通过预卷积块对语音信息进行预处理获得初步语音特征；在多尺度特征融合残差模块中，处理初步语音特征同时降低不相关信息对语音特征的干扰；在最终卷积块中，对多尺度特征融合残差模块输出的语音特征进行处理获得最终语音特征；所述最终语音特征经过最大池化层和全连接层后，得到关键词识别结果。本发明中分别在时域与频域中提取更深层次的语音信息，避免不同领域信息之间可能存在的相互干扰；时域全局卷积和频域全局卷积可分别在时域和频域中捕捉语音信息的全局特征，增强模型的全局特征感知能力以学习更丰富的特征表示。
神经网络的训练方法、语音降噪方法、设备及存储介质 神经网络的训练方法、语音降噪方法、设备及存储介质
本申请实施例提供一种神经网络的训练方法、语音降噪方法、计算机程序产品、设备及存储介质。在训练神经网络时，可以对神经网络的网络参数进行位宽截断处理，利用位宽截断处理后的网络参数确定的降噪参数的准确度，以及位宽截断处理对网络参数本身的影响作为神经网络训练过程中的约束，从而可以最小化位宽截断处理对数据精度的影响，训练得到轻量级且性能较好的语音降噪神经网络，使得该轻量级的语音降噪神经网络可以部署到低性能的语音采集设备中。
跨语言文本中实体语义识别处理方法、系统及存储介质 跨语言文本中实体语义识别处理方法、系统及存储介质
本申请公开了一种跨语言文本中实体语义识别处理方法、系统及存储介质，根据不同单词和相同单词在不同语言类别中进行发声的音素的长度不同，记录多个音素不同组成方式和对应的含义，将一串发声的音素对应的多个单词构建语句表。将语句表中的多类语言类别的单词翻译为同一语义类别，使得能够按照单词的语义来进行语义识别。本申请根据用户停顿情况进行语义的检测相较于普通按照前一个单词进行检测，能够更加准确地进行语义识别，通过语句表进行多种语言的语义识别，大大减轻了计算机的计算量，更加准确快速的对其进行跨语言文本的语义识别。即，本申请的方案可以把包含不同语言类别的语句翻译成预设的语言类别的语句，且翻译准确性高。
一种高效文字转语音的方法及系统  一种高效文字转语音的方法及系统 
 本申请提供一种高效文字转语音的方法及系统。其中，接收用户输入的文本信息，识别并分析所述文本信息中的情感色彩和语气特征；根据所述情感色彩和所述语气特征，从预先构建的情感语音库中选择相匹配的基础语音片段的数据集；利用动态时间规整算法调整所述基础语音片段的时间轴，使所述基础语音片段的时间轴与所述文本信息的语速相适应的同时保持所述情感色彩的一致性；采用频谱融合技术，将调整后的时间轴与所述文本信息的音素序列进行融合，生成语音输出，其中，所述频谱融合技术用以确保不同的情感色彩的基础语音片段在连接处平滑过渡。本申请提供的技术方案提高了语音合成的情感表达能力、自然度和连贯性，从而大幅提升了用户体验。
一种用于智慧呼叫的语义识别方法及系统  一种用于智慧呼叫的语义识别方法及系统 
 本发明涉及语音识别技术领域，具体涉及一种用于智慧呼叫的语义识别方法及系统。本发明首先获取用户呼叫的每句呼叫语句的语音文本、回应时间和答案文本；进一步根据目标用户呼叫中语音文本与每类答案文本的相似特征，获取目标用户呼叫与每类答案文本的匹配系数，确定目标用户呼叫对应的答案文本类别；进一步根据相同答案文本类别相邻的用户呼叫中语音文本的相似特征，目标用户呼叫中呼叫语句与对应答案文本的相似特征和回应时间，以及相邻呼叫语句的相似特征，结合匹配系数，从多个方面准确评估系统对于目标用户呼叫的修正识别效率，使得系统能够及时发现识别效率的瓶颈，从而针对性地对系统进行优化，提升系统的智能化水平。

技术分类

电信、广播电视和卫星传输服务电信、广播电视和卫星传输服务

互联网软件服务互联网软件服务

集成电路设计集成电路设计

信息集成数字服务信息集成数字服务

电气机械制造电气机械制造

计算机、通信、电子设备制造计算机、通信、电子设备制造

医药制造、生物基材料医药制造、生物基材料

石油煤矿化学用品加工石油煤矿化学用品加工

化学原料制品加工化学原料制品加工

非金属矿物加工非金属矿物加工

金属制品加工金属制品加工

专用设备制造专用设备制造

通用设备制造通用设备制造

通用零部件制造通用零部件制造

汽车制造业汽车制造业

铁路、船舶、航天设备制造铁路、船舶、航天设备制造

电力、热力生产和供应电力、热力生产和供应

燃气生产和供应燃气生产和供应

水生产和供应水生产和供应

房屋建筑、土木工程房屋建筑、土木工程

交通运输、仓储和邮政交通运输、仓储和邮政

农、林、牧、渔业农、林、牧、渔业

采矿业采矿业

农副、食品加工农副、食品加工

烟草、酒水加工烟草、酒水加工

纺织皮具居家制品纺织皮具居家制品

文教体娱加工文教体娱加工