语音识别 标签

浏览标签 语音识别 下的公开文章、摘要与延伸阅读。肖恩子的知识花园

标签:语音识别排序:发表时间倒序
推出 NVIDIA Nemotron 3 Nano Omni:面向文档、音频和视频智能体的长上下文多模态智能英文
17

推出 NVIDIA Nemotron 3 Nano Omni:面向文档、音频和视频智能体的长上下文多模态智能

开源项目
GUI代理全模态+3
作者: NVIDIA
发表时间

NVIDIA推出Nemotron 3 Nano Omni,将Nemotron扩展为统一处理文本、图像、视频和音频的多模态理解模型,面向长文档分析、语音识别、长音视频理解、GUI代理和通用推理,在文档、视频、音频多项基准上领先,并以混合Mamba-Transformer-MoE架构和分阶段训练实现更长上下文、更高精度及最高9倍吞吐提升。

VibeVoice:微软开源的语音AI模型中文
17

VibeVoice:微软开源的语音AI模型

开源项目
实时流式语音合成+3
作者: Microsoft
发表时间

VibeVoice是微软开源的前沿语音AI模型家族,包含语音识别(ASR)和语音合成(TTS)两大方向。核心创新采用7.5Hz超低帧率的连续语音分词器,结合大语言模型与扩散模型实现高效长序列处理。

每页显示 2
上一页 1 / 1 下一页