线性复杂度语音识别模型架构创新

123技术园

首页 / 技术内容

线性复杂度语音识别模型架构创新

2025-01-14 15:27

No.1328747428714913792

技术概要

PDF全文

本创新技术介绍了一种语音识别领域的新型线性复杂度模型架构。该架构中，AMLP分支采用MLP替代传统注意力机制，并引入注意力平均池化层，以维持线性复杂度并实现注意力权重的均匀分布，从而获取全面的全局特征。同时，卷积分支通过卷积空间门控单元增强局部特征关系，并与AMLP分支进行信息交互，将局部特征与全局特征混合，为全局特征补充局部细节。该技术通过在特征提取阶段提前融合局部和全局特征，有效解决了两者实时相互影响的问题。

背景技术

近年来，大量研究集中在对Conformer的结构改进，旨在进一步降低计算开销并提升识别性能。例如，Branchformer（Peng et al.，2022）通过引入并行分支对不同范围的上下文特征进行建模，其中一个分支采用卷积门控多层感知机（cgMLP）捕获局部上下文特征，另一个分支利用自注意机制捕捉长程特征依赖关系，Branchformer结构如图1所示，但是该结构存在两个问题：第一，局部特征和全局特征完全分离的方式是主流模式，但这种进行局部特征和全局特征独立提取再拼接融合的方式，并没有解决全局特征和局部特征实时都在相互影响的问题，因此本文在提取局部特征和全局特征的同时，适当的在局部特征和全局特征提取处理时进行了提前融合，来解决全局特征和局部特征实时相互影响的问题。第二，注意力计算复杂度高，对硬件设备依赖严重。MLP Mixer（Tolstikhin etal., 2021）通过固定大小的MLP在时间维度上进行令牌混合，在多个任务上展示了与多头自注意机制（MHSA）相媲美的性能（Choe et al., 2022）。但是，鉴于语音任务通常涉及可变长度的序列，MLP Mixer在语音任务中的应用受限，导致其性能表现不佳。

实现思路

阅读余下40%

技术概要为部分技术内容，查看PDF获取完整资料

该技术已申请专利，如用于商业用途，请联系技术所有人！

技术研发人员：

刘葳田志野许春生孙一鸣陈纯毅

技术所属：长春理工大学

相关技术

一种维纳增益的设计方法  一种维纳增益的设计方法 
 本发明公开了一种维纳增益的设计方法，包括:进行维纳增益估计，将估计获得的维纳增益作为后置滤波器，所述维纳增益估计过程包括：根据波束形成器输出的输出信号进行信噪比估计，得到信噪比估计值；在噪声和混响环境下，根据信噪比估计值及由麦克风阵列采集的观测信号进行相干散射比估计，得到相干散射比估计值；根据信噪比估计值及相干散射比估计值进行增益估计，得到维纳增益。本发明综合考虑了CDR和SNR来设计维纳增益，大大提升了语音增强技术在语音降噪、失真度控制以及去混响能力等方面的性能。
基于FPGA的深海水声数据压缩方法与装置  基于FPGA的深海水声数据压缩方法与装置 
 本申请涉及声波数据处理技术领域，具体涉及基于FPGA的深海水声数据压缩方法与装置，该方法包括:根据深海水声数据模态分解得到IMF波的能量分布进行分段处理，得到各段声音数据；根据任意两段声音数据的振幅数值及变化的相似情况，得到声音相似性度量；根据所有不同IMF波上相同时间段的声音数据以及同一IMF波上不同声音数据的声音相似性度量，得到信息浓度；根据信息浓度选取小波变换过程中的小波基函数组，对所有IMF波小波变化后的小波系数进行量化后编码，得到深海水声数据的压缩结果。本申请可提高深海水声数据的压缩质量。
一种自适应感知的一维离散时间信号活动检测方法和系统  一种自适应感知的一维离散时间信号活动检测方法和系统 
 本发明提供了一种自适应感知的一维离散时间信号活动检测方法和系统，首先通过预加重补偿一维离散时间信号的频谱衰减，然后将预加重后的一维时间信号流按固定长度分成多个短的时间帧，接着对帧信号进行加窗处理，随后计算单帧信号的短时能量积分，并进行动态能量阈值调整，阈值调整包括自适应跟随阈值调整和后级识别神经网络辅助调整，调整后得到一个当前的能量阈值，在得到的当前能量阈值的基础上加上一个常数作为判决阈值，最后采用判决阈值进行信号活动检测，得到信号帧实时的分类结果。通过动态的能量阈值调整，使得最后的能量阈值跟随在信号幅值附近，达到了自适应环境的目的，大大提高了信号活动检测的准确率，降低了设备功耗。
一种基于多域声学特征融合的说话人识别方法、装置及设备  一种基于多域声学特征融合的说话人识别方法、装置及设备 
 本发明涉及一种基于多域声学特征融合的说话人识别方法，包括以下步骤:获取待识别的语音数据；分别提取每个语音数据的频谱图和分数频谱图；将频谱图和分数频谱图经过滤波器组，分别得到第一Fbank特征和第二Fbank特征，并将第一Fbank特征和第二Fbank特征组合成声学特征；采用特征融合方法将声学特征融合；将融合后的声学特征输入说话人识别网络模型中，得到待识别说话人语音的声纹特征；根据待识别说话人语音的声纹特征，得到识别结果。本发明得到了高精度和高区分度的声纹特征，提高了说话人识别准确性。
一种语音转换的信息处理方法和系统  一种语音转换的信息处理方法和系统 
 本发明属于信息处理领域，本发明提供了一种语音转换的信息处理方法和系统，包括:基于所有收集语音数据的接口，获取所有需要语音转换的语音信号数据，进行降噪处理，得到初降噪语音信号；获取语音信号的基频和共振峰位置，分析处理得到性别特征值并将其进行划分；基于性别分类后的语音信息，获取语音信息的波形数据进行综合分析处理得到情绪特征值并分类处理；基于降噪处理后的语音信息，转换出语音信息对应的官方文字信息并将语音信息携带的性别和情绪信息附加在文字信息中；将语音转换后的官方语言文字转换成官方语音信息，并将语音信息携带的性别和情绪信息附加在转换后的语音信息中，提高人机交互的质量，改善人类日常生活和工作体验。
基于多尺度全局卷积网络的语音关键词识别方法及系统  基于多尺度全局卷积网络的语音关键词识别方法及系统 
 本发明公开了基于多尺度全局卷积网络的语音关键词识别方法及系统，涉及语音识别技术领域，包括以下步骤:通过预卷积块对语音信息进行预处理获得初步语音特征；在多尺度特征融合残差模块中，处理初步语音特征同时降低不相关信息对语音特征的干扰；在最终卷积块中，对多尺度特征融合残差模块输出的语音特征进行处理获得最终语音特征；所述最终语音特征经过最大池化层和全连接层后，得到关键词识别结果。本发明中分别在时域与频域中提取更深层次的语音信息，避免不同领域信息之间可能存在的相互干扰；时域全局卷积和频域全局卷积可分别在时域和频域中捕捉语音信息的全局特征，增强模型的全局特征感知能力以学习更丰富的特征表示。
神经网络的训练方法、语音降噪方法、设备及存储介质 神经网络的训练方法、语音降噪方法、设备及存储介质
本申请实施例提供一种神经网络的训练方法、语音降噪方法、计算机程序产品、设备及存储介质。在训练神经网络时，可以对神经网络的网络参数进行位宽截断处理，利用位宽截断处理后的网络参数确定的降噪参数的准确度，以及位宽截断处理对网络参数本身的影响作为神经网络训练过程中的约束，从而可以最小化位宽截断处理对数据精度的影响，训练得到轻量级且性能较好的语音降噪神经网络，使得该轻量级的语音降噪神经网络可以部署到低性能的语音采集设备中。
跨语言文本中实体语义识别处理方法、系统及存储介质 跨语言文本中实体语义识别处理方法、系统及存储介质
本申请公开了一种跨语言文本中实体语义识别处理方法、系统及存储介质，根据不同单词和相同单词在不同语言类别中进行发声的音素的长度不同，记录多个音素不同组成方式和对应的含义，将一串发声的音素对应的多个单词构建语句表。将语句表中的多类语言类别的单词翻译为同一语义类别，使得能够按照单词的语义来进行语义识别。本申请根据用户停顿情况进行语义的检测相较于普通按照前一个单词进行检测，能够更加准确地进行语义识别，通过语句表进行多种语言的语义识别，大大减轻了计算机的计算量，更加准确快速的对其进行跨语言文本的语义识别。即，本申请的方案可以把包含不同语言类别的语句翻译成预设的语言类别的语句，且翻译准确性高。
一种高效文字转语音的方法及系统  一种高效文字转语音的方法及系统 
 本申请提供一种高效文字转语音的方法及系统。其中，接收用户输入的文本信息，识别并分析所述文本信息中的情感色彩和语气特征；根据所述情感色彩和所述语气特征，从预先构建的情感语音库中选择相匹配的基础语音片段的数据集；利用动态时间规整算法调整所述基础语音片段的时间轴，使所述基础语音片段的时间轴与所述文本信息的语速相适应的同时保持所述情感色彩的一致性；采用频谱融合技术，将调整后的时间轴与所述文本信息的音素序列进行融合，生成语音输出，其中，所述频谱融合技术用以确保不同的情感色彩的基础语音片段在连接处平滑过渡。本申请提供的技术方案提高了语音合成的情感表达能力、自然度和连贯性，从而大幅提升了用户体验。
一种用于智慧呼叫的语义识别方法及系统  一种用于智慧呼叫的语义识别方法及系统 
 本发明涉及语音识别技术领域，具体涉及一种用于智慧呼叫的语义识别方法及系统。本发明首先获取用户呼叫的每句呼叫语句的语音文本、回应时间和答案文本；进一步根据目标用户呼叫中语音文本与每类答案文本的相似特征，获取目标用户呼叫与每类答案文本的匹配系数，确定目标用户呼叫对应的答案文本类别；进一步根据相同答案文本类别相邻的用户呼叫中语音文本的相似特征，目标用户呼叫中呼叫语句与对应答案文本的相似特征和回应时间，以及相邻呼叫语句的相似特征，结合匹配系数，从多个方面准确评估系统对于目标用户呼叫的修正识别效率，使得系统能够及时发现识别效率的瓶颈，从而针对性地对系统进行优化，提升系统的智能化水平。

技术分类

电信、广播电视和卫星传输服务电信、广播电视和卫星传输服务

互联网软件服务互联网软件服务

集成电路设计集成电路设计

信息集成数字服务信息集成数字服务

电气机械制造电气机械制造

计算机、通信、电子设备制造计算机、通信、电子设备制造

医药制造、生物基材料医药制造、生物基材料

石油煤矿化学用品加工石油煤矿化学用品加工

化学原料制品加工化学原料制品加工

非金属矿物加工非金属矿物加工

金属制品加工金属制品加工

专用设备制造专用设备制造

通用设备制造通用设备制造

通用零部件制造通用零部件制造

汽车制造业汽车制造业

铁路、船舶、航天设备制造铁路、船舶、航天设备制造

电力、热力生产和供应电力、热力生产和供应

燃气生产和供应燃气生产和供应

水生产和供应水生产和供应

房屋建筑、土木工程房屋建筑、土木工程

交通运输、仓储和邮政交通运输、仓储和邮政

农、林、牧、渔业农、林、牧、渔业

采矿业采矿业

农副、食品加工农副、食品加工

烟草、酒水加工烟草、酒水加工

纺织皮具居家制品纺织皮具居家制品

文教体娱加工文教体娱加工