深度学习技术在录播教室语音增强中的应用

123技术园

首页 / 技术内容

深度学习技术在录播教室语音增强中的应用

2025-01-19 11:26

No.1330499860612521984

技术概要

PDF全文

本技术介绍了一种利用深度学习技术对录播教室采集的语音信号进行增强的方法，旨在提升音频的清晰度和可懂度。该方法在传统的深度复卷积神经网络框架下，提出了一种结合时频长短时记忆网络(F-T-LSTM)和混合注意力机制的优化网络结构。该结构通过F-T-LSTM更精确地捕捉语音的时域和频域特性，并结合通道注意力与空间注意力机制，实现对复数域语音特征的全面提取。这种设计有效集中计算资源于语谱图中信息量最大的区域，显著提升了语音增强网络的性能，并且展现出强大的泛化能力。

背景技术

在日常生活中，人们通过语音来传递信息，语音是一种广泛的交流介质，随着人工智能的发展，语音交流的方式不仅限于人与人之间还存在于人与机器设备之间，机器听觉系统的开发和应用成为重要的研究方向。在复杂的声学环境中，环境音干扰、室内混响以及其他说话人声音的干扰都会影响到机器设备采集到的语音音频质量，从而影响语音信号的识别与分析，特别是在实际环境中，噪声信号、混响信号与纯净语音信号难以分离，所以对于智能语音设备改善语音信号的质量是长久以来的研究目标。如今，随着通信技术的发展以及信息化教学在校园教学过程中的应用普及，人们对高质量的信息化教学课堂提出了新的标准和新的要求。特别是在《教育信息化2.0行动计划》大背景下，许多高校通过建设校园智慧教室来提升教育信息化水平，其中常态化录播教室打造便成为了重要的信息化建设场景。海量的课堂录播音视频资源不仅可以供教师和学生用于教学活动，同时这些课程资源也将作为学校构建专业、学科体系及知识图谱的宝贵知识素材，但由于各种教室环境因素、硬件设备差异，许多音频视频资源呈现出环境音嘈杂等情况导致录播课程无法满足教师、学生课后回顾复习或者用于智能教学监测等需求。因此，利用深度学习模型从大量的语音数据中学习到语音信号的特征和模式，将其用于教室内的语音增强任务，从而保证音频资源听感效果更佳，更具备使用价值，实现录播音频最大程度优化，能够听清教师、学生说话内容，实现环境音低的效果，从而达到良好的教学学习体验。

实现思路

阅读余下40%

技术概要为部分技术内容，查看PDF获取完整资料

该技术已申请专利，如用于商业用途，请联系技术所有人！

技术研发人员：

张馨匀黄智轩周李罗大威

技术所属：桂林电子科技大学

相关技术

一种维纳增益的设计方法  一种维纳增益的设计方法 
 本发明公开了一种维纳增益的设计方法，包括:进行维纳增益估计，将估计获得的维纳增益作为后置滤波器，所述维纳增益估计过程包括：根据波束形成器输出的输出信号进行信噪比估计，得到信噪比估计值；在噪声和混响环境下，根据信噪比估计值及由麦克风阵列采集的观测信号进行相干散射比估计，得到相干散射比估计值；根据信噪比估计值及相干散射比估计值进行增益估计，得到维纳增益。本发明综合考虑了CDR和SNR来设计维纳增益，大大提升了语音增强技术在语音降噪、失真度控制以及去混响能力等方面的性能。
基于FPGA的深海水声数据压缩方法与装置  基于FPGA的深海水声数据压缩方法与装置 
 本申请涉及声波数据处理技术领域，具体涉及基于FPGA的深海水声数据压缩方法与装置，该方法包括:根据深海水声数据模态分解得到IMF波的能量分布进行分段处理，得到各段声音数据；根据任意两段声音数据的振幅数值及变化的相似情况，得到声音相似性度量；根据所有不同IMF波上相同时间段的声音数据以及同一IMF波上不同声音数据的声音相似性度量，得到信息浓度；根据信息浓度选取小波变换过程中的小波基函数组，对所有IMF波小波变化后的小波系数进行量化后编码，得到深海水声数据的压缩结果。本申请可提高深海水声数据的压缩质量。
一种自适应感知的一维离散时间信号活动检测方法和系统  一种自适应感知的一维离散时间信号活动检测方法和系统 
 本发明提供了一种自适应感知的一维离散时间信号活动检测方法和系统，首先通过预加重补偿一维离散时间信号的频谱衰减，然后将预加重后的一维时间信号流按固定长度分成多个短的时间帧，接着对帧信号进行加窗处理，随后计算单帧信号的短时能量积分，并进行动态能量阈值调整，阈值调整包括自适应跟随阈值调整和后级识别神经网络辅助调整，调整后得到一个当前的能量阈值，在得到的当前能量阈值的基础上加上一个常数作为判决阈值，最后采用判决阈值进行信号活动检测，得到信号帧实时的分类结果。通过动态的能量阈值调整，使得最后的能量阈值跟随在信号幅值附近，达到了自适应环境的目的，大大提高了信号活动检测的准确率，降低了设备功耗。
一种基于多域声学特征融合的说话人识别方法、装置及设备  一种基于多域声学特征融合的说话人识别方法、装置及设备 
 本发明涉及一种基于多域声学特征融合的说话人识别方法，包括以下步骤:获取待识别的语音数据；分别提取每个语音数据的频谱图和分数频谱图；将频谱图和分数频谱图经过滤波器组，分别得到第一Fbank特征和第二Fbank特征，并将第一Fbank特征和第二Fbank特征组合成声学特征；采用特征融合方法将声学特征融合；将融合后的声学特征输入说话人识别网络模型中，得到待识别说话人语音的声纹特征；根据待识别说话人语音的声纹特征，得到识别结果。本发明得到了高精度和高区分度的声纹特征，提高了说话人识别准确性。
一种语音转换的信息处理方法和系统  一种语音转换的信息处理方法和系统 
 本发明属于信息处理领域，本发明提供了一种语音转换的信息处理方法和系统，包括:基于所有收集语音数据的接口，获取所有需要语音转换的语音信号数据，进行降噪处理，得到初降噪语音信号；获取语音信号的基频和共振峰位置，分析处理得到性别特征值并将其进行划分；基于性别分类后的语音信息，获取语音信息的波形数据进行综合分析处理得到情绪特征值并分类处理；基于降噪处理后的语音信息，转换出语音信息对应的官方文字信息并将语音信息携带的性别和情绪信息附加在文字信息中；将语音转换后的官方语言文字转换成官方语音信息，并将语音信息携带的性别和情绪信息附加在转换后的语音信息中，提高人机交互的质量，改善人类日常生活和工作体验。
基于多尺度全局卷积网络的语音关键词识别方法及系统  基于多尺度全局卷积网络的语音关键词识别方法及系统 
 本发明公开了基于多尺度全局卷积网络的语音关键词识别方法及系统，涉及语音识别技术领域，包括以下步骤:通过预卷积块对语音信息进行预处理获得初步语音特征；在多尺度特征融合残差模块中，处理初步语音特征同时降低不相关信息对语音特征的干扰；在最终卷积块中，对多尺度特征融合残差模块输出的语音特征进行处理获得最终语音特征；所述最终语音特征经过最大池化层和全连接层后，得到关键词识别结果。本发明中分别在时域与频域中提取更深层次的语音信息，避免不同领域信息之间可能存在的相互干扰；时域全局卷积和频域全局卷积可分别在时域和频域中捕捉语音信息的全局特征，增强模型的全局特征感知能力以学习更丰富的特征表示。
神经网络的训练方法、语音降噪方法、设备及存储介质 神经网络的训练方法、语音降噪方法、设备及存储介质
本申请实施例提供一种神经网络的训练方法、语音降噪方法、计算机程序产品、设备及存储介质。在训练神经网络时，可以对神经网络的网络参数进行位宽截断处理，利用位宽截断处理后的网络参数确定的降噪参数的准确度，以及位宽截断处理对网络参数本身的影响作为神经网络训练过程中的约束，从而可以最小化位宽截断处理对数据精度的影响，训练得到轻量级且性能较好的语音降噪神经网络，使得该轻量级的语音降噪神经网络可以部署到低性能的语音采集设备中。
跨语言文本中实体语义识别处理方法、系统及存储介质 跨语言文本中实体语义识别处理方法、系统及存储介质
本申请公开了一种跨语言文本中实体语义识别处理方法、系统及存储介质，根据不同单词和相同单词在不同语言类别中进行发声的音素的长度不同，记录多个音素不同组成方式和对应的含义，将一串发声的音素对应的多个单词构建语句表。将语句表中的多类语言类别的单词翻译为同一语义类别，使得能够按照单词的语义来进行语义识别。本申请根据用户停顿情况进行语义的检测相较于普通按照前一个单词进行检测，能够更加准确地进行语义识别，通过语句表进行多种语言的语义识别，大大减轻了计算机的计算量，更加准确快速的对其进行跨语言文本的语义识别。即，本申请的方案可以把包含不同语言类别的语句翻译成预设的语言类别的语句，且翻译准确性高。
一种高效文字转语音的方法及系统  一种高效文字转语音的方法及系统 
 本申请提供一种高效文字转语音的方法及系统。其中，接收用户输入的文本信息，识别并分析所述文本信息中的情感色彩和语气特征；根据所述情感色彩和所述语气特征，从预先构建的情感语音库中选择相匹配的基础语音片段的数据集；利用动态时间规整算法调整所述基础语音片段的时间轴，使所述基础语音片段的时间轴与所述文本信息的语速相适应的同时保持所述情感色彩的一致性；采用频谱融合技术，将调整后的时间轴与所述文本信息的音素序列进行融合，生成语音输出，其中，所述频谱融合技术用以确保不同的情感色彩的基础语音片段在连接处平滑过渡。本申请提供的技术方案提高了语音合成的情感表达能力、自然度和连贯性，从而大幅提升了用户体验。
一种用于智慧呼叫的语义识别方法及系统  一种用于智慧呼叫的语义识别方法及系统 
 本发明涉及语音识别技术领域，具体涉及一种用于智慧呼叫的语义识别方法及系统。本发明首先获取用户呼叫的每句呼叫语句的语音文本、回应时间和答案文本；进一步根据目标用户呼叫中语音文本与每类答案文本的相似特征，获取目标用户呼叫与每类答案文本的匹配系数，确定目标用户呼叫对应的答案文本类别；进一步根据相同答案文本类别相邻的用户呼叫中语音文本的相似特征，目标用户呼叫中呼叫语句与对应答案文本的相似特征和回应时间，以及相邻呼叫语句的相似特征，结合匹配系数，从多个方面准确评估系统对于目标用户呼叫的修正识别效率，使得系统能够及时发现识别效率的瓶颈，从而针对性地对系统进行优化，提升系统的智能化水平。

技术分类

电信、广播电视和卫星传输服务电信、广播电视和卫星传输服务

互联网软件服务互联网软件服务

集成电路设计集成电路设计

信息集成数字服务信息集成数字服务

电气机械制造电气机械制造

计算机、通信、电子设备制造计算机、通信、电子设备制造

医药制造、生物基材料医药制造、生物基材料

石油煤矿化学用品加工石油煤矿化学用品加工

化学原料制品加工化学原料制品加工

非金属矿物加工非金属矿物加工

金属制品加工金属制品加工

专用设备制造专用设备制造

通用设备制造通用设备制造

通用零部件制造通用零部件制造

汽车制造业汽车制造业

铁路、船舶、航天设备制造铁路、船舶、航天设备制造

电力、热力生产和供应电力、热力生产和供应

燃气生产和供应燃气生产和供应

水生产和供应水生产和供应

房屋建筑、土木工程房屋建筑、土木工程

交通运输、仓储和邮政交通运输、仓储和邮政

农、林、牧、渔业农、林、牧、渔业

采矿业采矿业

农副、食品加工农副、食品加工

烟草、酒水加工烟草、酒水加工

纺织皮具居家制品纺织皮具居家制品

文教体娱加工文教体娱加工