作为国内落地规模领先的智能语音转写产品,讯飞听见依托科大讯飞的底层技术积累,针对会议转录、采访录音整理、日常语音录入等多场景需求实现了高准确率的识别效果,其核心技术架构和优化路径也为行业提供了可参考的范式。

讯飞听见采用端云协同的识别架构,完整识别流程分为前端信号处理、声学特征提取、模型推理解码三个核心环节。首先前端信号处理会针对输入音频完成回声消除、降噪、语音活动检测(vad),提前过滤静音、环境噪音、电流声等无效信号,区分不同说话人发言片段,为后续识别降低干扰。其次,技术核心是改进版端到端语音识别模型,区别于传统hmm-gmm混合架构,当前主流模型以transformer为基础,通过自注意力机制捕捉长跨度音频依赖,提取fbank音频特征后,由声学模型完成音频到音素、汉字的映射,再搭配经过领域预训练的中文语言模型,解决同音字、多音字、方言口音带来的歧义问题,最终输出通顺的识别文本。针对中文语境的特点,模型还融入了汉字构词规则、通用常用语料库的先验知识,进一步提升了通用场景的识别准确率。

针对不同场景下的识别需求,讯飞听见的模型能力可从多个维度针对性优化。首先是场景化小样本微调,通用模型在专业领域如医疗、法律、工业会议场景容易出现术语识别错误,可采用参数高效的lora微调方法,仅需要百小时级别的目标场景标注语料,就能在不改动模型主干参数的前提下,提升专业术语识别准确率,训练和部署成本远低于全模型微调。其次是噪声鲁棒性优化,针对户外、开放会议室等嘈杂场景,可通过多场景数据增强扩充训练集,加入不同信噪比的真实环境噪音样本,同时优化vad模型的判断阈值,进一步降低噪音片段的误识别率。最后是上下文语义优化,针对长音频转写的歧义问题,可引入动态语义记忆窗口,将前文发言的语义特征融入当前识别的解码过程,结合上下文修正同音字错误,长会议识别准确率可提升3%-5%。此外面向隐私需求高的离线识别场景,可通过模型量化、结构化剪枝完成轻量化压缩,在准确率损失小于1%的前提下,将模型体积压缩60%以上,满足端侧离线部署的需求。全文约795字。
下一篇:没有了