流式语音识别技术：注意力机制与边界检测的融合

123技术园

首页 / 技术内容

2025-01-16 13:40

No.1329446262986252288

技术概要

PDF全文

本技术方案专注于语音识别领域，提出了一种结合注意力机制与边界检测的流式语音识别方法。该方法首先对音频进行分割处理，提取特征生成对数梅尔频谱图，随后利用非流式模型进行处理，以实现高效的语音识别。

背景技术

自动语音识别技术通过将音频信号转录为文字内容，在科研和日常生活中扮演着重要角色。流式语音识别能够在音频流输入的过程中实时输出转录文本。而基于Transformer的语音识别模型，是将音频信号一次性转换为向量表示，然后通过解码器（Decoder）模块进行自回归解码。这类模型在非流式语音识别任务中表现出色，但用于流式语音识别时效果不佳，并且会消耗更多的计算资源。一些传统方法为解决非流式模型在流式识别中的挑战，采用局部转录策略。通常是将音频分成小片段，模型对这些片段分别进行转录，并寻找多个片段转录内容中的最长公共前缀。虽然这类方法无需修改模型的参数和结构，且能实现较为有效的流式语音识别，但其在控制转录延迟性和不确定性上表现较弱，同时也带来了较大的计算开销。在语音翻译领域，非流式模型的流式翻译同样是一个关键挑战。一些研究方法聚焦于Transformer模型中的注意力机制，以此来控制解码时机，判断音频帧的最大注意力权重是否接近音频片段末尾，或在末尾帧的注意力权重达到某个阈值。这种方式也可以应用于语音识别领域。相比于局部转录策略，基于交叉注意力的解码策略能够降低转录的延迟性。然而，基于注意力机制控制解码的方式往往关注最大注意力权重的位置，但这种做法存在一定的准确性问题。仅关注最大注意力权重可能会忽略背景噪声，并导致模型陷入局部不稳定的区域。因此，应该扩展到更广域的权重值进行考量。此外，转录结果的可靠性也不完全保障。多个音频片段可能会切割一个完整单词，此时需要通过单词边界检测机制来防止这种情况发生。如果解码过程中出现过早停止的情况，边界检测也可以帮助纠正解码时机。一些方法通过线性层或循环神经网络（RNN）来检测转录内容的边界，但在处理复杂音频时，这类方法的表现欠佳，效率较低。同时，转录内容的不可靠性也会影响边界检测的效果。

实现思路

阅读余下40%

技术概要为部分技术内容，查看PDF获取完整资料

该技术已申请专利，如用于商业用途，请联系技术所有人！

技术研发人员：

刘军平王润鹏谢浩谢屈波

技术所属：武汉纺织大学

相关技术

一种维纳增益的设计方法  一种维纳增益的设计方法 
 本发明公开了一种维纳增益的设计方法，包括:进行维纳增益估计，将估计获得的维纳增益作为后置滤波器，所述维纳增益估计过程包括：根据波束形成器输出的输出信号进行信噪比估计，得到信噪比估计值；在噪声和混响环境下，根据信噪比估计值及由麦克风阵列采集的观测信号进行相干散射比估计，得到相干散射比估计值；根据信噪比估计值及相干散射比估计值进行增益估计，得到维纳增益。本发明综合考虑了CDR和SNR来设计维纳增益，大大提升了语音增强技术在语音降噪、失真度控制以及去混响能力等方面的性能。
基于FPGA的深海水声数据压缩方法与装置  基于FPGA的深海水声数据压缩方法与装置 
 本申请涉及声波数据处理技术领域，具体涉及基于FPGA的深海水声数据压缩方法与装置，该方法包括:根据深海水声数据模态分解得到IMF波的能量分布进行分段处理，得到各段声音数据；根据任意两段声音数据的振幅数值及变化的相似情况，得到声音相似性度量；根据所有不同IMF波上相同时间段的声音数据以及同一IMF波上不同声音数据的声音相似性度量，得到信息浓度；根据信息浓度选取小波变换过程中的小波基函数组，对所有IMF波小波变化后的小波系数进行量化后编码，得到深海水声数据的压缩结果。本申请可提高深海水声数据的压缩质量。
一种自适应感知的一维离散时间信号活动检测方法和系统  一种自适应感知的一维离散时间信号活动检测方法和系统 
 本发明提供了一种自适应感知的一维离散时间信号活动检测方法和系统，首先通过预加重补偿一维离散时间信号的频谱衰减，然后将预加重后的一维时间信号流按固定长度分成多个短的时间帧，接着对帧信号进行加窗处理，随后计算单帧信号的短时能量积分，并进行动态能量阈值调整，阈值调整包括自适应跟随阈值调整和后级识别神经网络辅助调整，调整后得到一个当前的能量阈值，在得到的当前能量阈值的基础上加上一个常数作为判决阈值，最后采用判决阈值进行信号活动检测，得到信号帧实时的分类结果。通过动态的能量阈值调整，使得最后的能量阈值跟随在信号幅值附近，达到了自适应环境的目的，大大提高了信号活动检测的准确率，降低了设备功耗。
一种基于多域声学特征融合的说话人识别方法、装置及设备  一种基于多域声学特征融合的说话人识别方法、装置及设备 
 本发明涉及一种基于多域声学特征融合的说话人识别方法，包括以下步骤:获取待识别的语音数据；分别提取每个语音数据的频谱图和分数频谱图；将频谱图和分数频谱图经过滤波器组，分别得到第一Fbank特征和第二Fbank特征，并将第一Fbank特征和第二Fbank特征组合成声学特征；采用特征融合方法将声学特征融合；将融合后的声学特征输入说话人识别网络模型中，得到待识别说话人语音的声纹特征；根据待识别说话人语音的声纹特征，得到识别结果。本发明得到了高精度和高区分度的声纹特征，提高了说话人识别准确性。
一种语音转换的信息处理方法和系统  一种语音转换的信息处理方法和系统 
 本发明属于信息处理领域，本发明提供了一种语音转换的信息处理方法和系统，包括:基于所有收集语音数据的接口，获取所有需要语音转换的语音信号数据，进行降噪处理，得到初降噪语音信号；获取语音信号的基频和共振峰位置，分析处理得到性别特征值并将其进行划分；基于性别分类后的语音信息，获取语音信息的波形数据进行综合分析处理得到情绪特征值并分类处理；基于降噪处理后的语音信息，转换出语音信息对应的官方文字信息并将语音信息携带的性别和情绪信息附加在文字信息中；将语音转换后的官方语言文字转换成官方语音信息，并将语音信息携带的性别和情绪信息附加在转换后的语音信息中，提高人机交互的质量，改善人类日常生活和工作体验。
基于多尺度全局卷积网络的语音关键词识别方法及系统  基于多尺度全局卷积网络的语音关键词识别方法及系统 
 本发明公开了基于多尺度全局卷积网络的语音关键词识别方法及系统，涉及语音识别技术领域，包括以下步骤:通过预卷积块对语音信息进行预处理获得初步语音特征；在多尺度特征融合残差模块中，处理初步语音特征同时降低不相关信息对语音特征的干扰；在最终卷积块中，对多尺度特征融合残差模块输出的语音特征进行处理获得最终语音特征；所述最终语音特征经过最大池化层和全连接层后，得到关键词识别结果。本发明中分别在时域与频域中提取更深层次的语音信息，避免不同领域信息之间可能存在的相互干扰；时域全局卷积和频域全局卷积可分别在时域和频域中捕捉语音信息的全局特征，增强模型的全局特征感知能力以学习更丰富的特征表示。
神经网络的训练方法、语音降噪方法、设备及存储介质 神经网络的训练方法、语音降噪方法、设备及存储介质
本申请实施例提供一种神经网络的训练方法、语音降噪方法、计算机程序产品、设备及存储介质。在训练神经网络时，可以对神经网络的网络参数进行位宽截断处理，利用位宽截断处理后的网络参数确定的降噪参数的准确度，以及位宽截断处理对网络参数本身的影响作为神经网络训练过程中的约束，从而可以最小化位宽截断处理对数据精度的影响，训练得到轻量级且性能较好的语音降噪神经网络，使得该轻量级的语音降噪神经网络可以部署到低性能的语音采集设备中。
跨语言文本中实体语义识别处理方法、系统及存储介质 跨语言文本中实体语义识别处理方法、系统及存储介质
本申请公开了一种跨语言文本中实体语义识别处理方法、系统及存储介质，根据不同单词和相同单词在不同语言类别中进行发声的音素的长度不同，记录多个音素不同组成方式和对应的含义，将一串发声的音素对应的多个单词构建语句表。将语句表中的多类语言类别的单词翻译为同一语义类别，使得能够按照单词的语义来进行语义识别。本申请根据用户停顿情况进行语义的检测相较于普通按照前一个单词进行检测，能够更加准确地进行语义识别，通过语句表进行多种语言的语义识别，大大减轻了计算机的计算量，更加准确快速的对其进行跨语言文本的语义识别。即，本申请的方案可以把包含不同语言类别的语句翻译成预设的语言类别的语句，且翻译准确性高。
一种高效文字转语音的方法及系统  一种高效文字转语音的方法及系统 
 本申请提供一种高效文字转语音的方法及系统。其中，接收用户输入的文本信息，识别并分析所述文本信息中的情感色彩和语气特征；根据所述情感色彩和所述语气特征，从预先构建的情感语音库中选择相匹配的基础语音片段的数据集；利用动态时间规整算法调整所述基础语音片段的时间轴，使所述基础语音片段的时间轴与所述文本信息的语速相适应的同时保持所述情感色彩的一致性；采用频谱融合技术，将调整后的时间轴与所述文本信息的音素序列进行融合，生成语音输出，其中，所述频谱融合技术用以确保不同的情感色彩的基础语音片段在连接处平滑过渡。本申请提供的技术方案提高了语音合成的情感表达能力、自然度和连贯性，从而大幅提升了用户体验。
一种用于智慧呼叫的语义识别方法及系统  一种用于智慧呼叫的语义识别方法及系统 
 本发明涉及语音识别技术领域，具体涉及一种用于智慧呼叫的语义识别方法及系统。本发明首先获取用户呼叫的每句呼叫语句的语音文本、回应时间和答案文本；进一步根据目标用户呼叫中语音文本与每类答案文本的相似特征，获取目标用户呼叫与每类答案文本的匹配系数，确定目标用户呼叫对应的答案文本类别；进一步根据相同答案文本类别相邻的用户呼叫中语音文本的相似特征，目标用户呼叫中呼叫语句与对应答案文本的相似特征和回应时间，以及相邻呼叫语句的相似特征，结合匹配系数，从多个方面准确评估系统对于目标用户呼叫的修正识别效率，使得系统能够及时发现识别效率的瓶颈，从而针对性地对系统进行优化，提升系统的智能化水平。

技术分类

电信、广播电视和卫星传输服务电信、广播电视和卫星传输服务

互联网软件服务互联网软件服务

集成电路设计集成电路设计

信息集成数字服务信息集成数字服务

电气机械制造电气机械制造

计算机、通信、电子设备制造计算机、通信、电子设备制造

医药制造、生物基材料医药制造、生物基材料

石油煤矿化学用品加工石油煤矿化学用品加工

化学原料制品加工化学原料制品加工

非金属矿物加工非金属矿物加工

金属制品加工金属制品加工

专用设备制造专用设备制造

通用设备制造通用设备制造

通用零部件制造通用零部件制造

汽车制造业汽车制造业

铁路、船舶、航天设备制造铁路、船舶、航天设备制造

电力、热力生产和供应电力、热力生产和供应

燃气生产和供应燃气生产和供应

水生产和供应水生产和供应

房屋建筑、土木工程房屋建筑、土木工程

交通运输、仓储和邮政交通运输、仓储和邮政

农、林、牧、渔业农、林、牧、渔业

采矿业采矿业

农副、食品加工农副、食品加工

烟草、酒水加工烟草、酒水加工

纺织皮具居家制品纺织皮具居家制品

文教体娱加工文教体娱加工