小苗News |登顶世界第一!小苗天使轮领投项目「宇生月伴」领跑全球语音赛道

2026-08-14

近日,小苗天使轮领投企业「宇生月伴」(VUI Labs) 迎来里程碑式突破——其自研语音模型Luna-TTS在语音界最权威榜单之一的Hugging Face TTS Arena上力压群雄,击败ElevenLabs、MiniMax、Cartesia等国内外明星大厂,强势登顶全球第一!

与此同时,在独立AI评测平台Artificial Analysis的Speech Arena榜单上,Luna-TTS直接超越谷歌,斩获全球第三。

全球第一、碾压谷歌——中国语音赛道,正式迎来属于自己的“Thinking Machines”。

以下内容为转发
击败巨头登顶全球TOP 1,Luna-TTS 模型凭什么?

下面这段《人民的名义》中高育良和侯亮平的对话,背后到底是不是真人?要是不告诉你答案,打赌你猜不出来。

同理,这个视频,也是真人AI傻傻分不清。

英文的球赛解说,对物理发声细节还原得很真实,听觉体验直接拉满。

给自然纪录片配音,毫无违和感,仿佛背后真有个配音演员。

用在科技旁白的解说里,也是十分丝滑。

为什么现在的语音 AI 已经很好听了,但在情绪激动时依然偏生硬,操着不自然的播音腔?

这并非主流的自回归(AR)模型不够强大,而是它「从左到右逐字生成」的文本逻辑,难以充分刻画声音中多个维度同时变化的复杂性。

人类说话时,情绪、音色、呼吸是全局交织的;而 AR 架构强制单向顺序生成,不仅拉高了长句的延迟,还极易引发「一步错、步步错」的累积误差。

为了突破这一机制天花板,VUI Labs 拿出的王牌 Luna-TTS,提供了一条全新的破局路线,彻底颠覆了这种传统架构。

图片

Luna-TTS 把传统「逐Token生成语音」的路线,改造成了一套更像扩散模型的语音生成系统,同时还专门做了一条实时流式分支。

具体来说,它先把声音压缩成适合语言模型处理的离散Token,再让一个基于Qwen3改造的 Diffusion LM一次并行预测大量语音Token;需要实时对话时,则进一步改造成按块生成的Luna-TTS Realtime。

架构改造后,取得的结果惊人。

图片

arxiv:https://arxiv.org/abs/2608.11593

github demo page:https://vuilabs-ai.github.io/luna-tts


六项指标全球第一

Luna-TTS在「像真人」的五个层面上,都做到了非常突出的自然与稳定。

图片


更难得的是,它能根据不同语境切换情绪——在惊喜、克制、失落或调侃的状态下,会呈现完全不同的声音。每一句话,都仿佛带着温度。

人类的换气、犹豫、轻笑、叹气,以及说话过程中细微的情绪变化,构成了真实交流的质感,而Luna-TTS把这些信息,都呈现在了声音中。

而且,它的音视频克隆能力也是直接拉满。只需几分钟的样本,就能复刻出说话人的音色、语气甚至呼吸节奏,简直以假乱真。

比如亮剑中经典的意大利炮情节。

以及诸葛亮在两军阵前痛斥王朗的名场面。

这段《教父》的汉化版配音,真的绝了,完全还原出了原配音中的味道,沧桑又有压迫感。

六个第一的含金量:四项语音质量指标+两项模型效率指标

在最新的技术报告中,Luna-TTS不仅在Seed-TTS-Eval评测中关于语音质量的四项指标全拿第一(显著优势超越了字节Seed、MiniMax、智谱和Qwen系列等),更是在「野外」复杂环境下的CV3-Eval评测中,展现了惊人的纠错与抗噪能力。

图片

图片

这四个第一,含金量超高。

除了语音质量的性能指标上,它还在首包延迟和实时率两个效率指标上,也是第一。

总结来说,就是语音质量最好、生成效率最高、首包延迟最低。

图片

首包延迟全球第一

图片

端到端实时率(RTF)位列第一

它到底牛在哪里?核心就在于以下突破。

架构演进:从预训练 AR 语言模型到 Block Diffusion 的「三步走」

在 TTS 领域,从基座语言模型初始化,是业界公认的有效范式。文本大模型天然具备强大的多语言文本理解、字词对齐、拼写规则以及复杂语种(如日韩语)的书写系统建模能力。

因此,团队并没有从头训练声学模型,而是从Qwen3-0.6B出发,设计了一套清晰的渐进式改造路线。

图片

在 CV3-Eval 等 Benchmark 中,存在大量长句、不规则标点及复杂口语等「难文本」。

面对这种难文本,双向扩散架构是更合适的。

原因就在于,AR模型自身有很大的局限性。

自回归模型采用左到右的 Next-Token 预测,一旦前期采样出现微小偏差,错误就会在 Prefix 中永久冻结并滚雪球式累积,导致 TTS 常见的跳字、重复和吞音。

这就体现出了双向 Diffusion的优势:TTS 与自由文本生成不同,其输出音频的语义内容本质上被输入文本高度约束。

双向掩码扩散,允许模型在去噪过程中同时看到全局的过去和未来上下文,通过多步置信度精炼动态修正局部错误,这就大幅消除了暴露偏差。  

Tokenizer 创新:Luna-Codec 的「语义锚定」与声学解耦

第二点,就是Tokenizer的创新。

在多码本 Residual Vector Quantization神经编解码器中,如果直接进行端到端重构训练,前几个码本(Codebooks)往往会过早卷入细微的频谱细节,导致文本向音频 Token 的预测极其不稳定。

为此,Luna-Codec采用了8 码本架构,在24kHz的采样率下达到了25Hz帧率(每秒 200 个 Token)。

图片

在训练 Tokenizer 时,团队通过引入额外的预训练 WavLM 语义蒸馏 Loss,将语言/语义信息强行「锚定」在第一层码本(CB1)中。  

CB1 负责提供稳定的语言/字音骨架,剩下的 CB2–CB8 码本则自由捕获音色、环境声道、情绪和韵律细节。

这种从「语义到声学」的层次化设计,大幅降低了扩散模型从文本预测完整音频网格的难度。

强化学习突破:离散掩码扩散模型上的 GRPO 迁移

Luna-TTS的核心算法创新之一,是将基于GRPO的强化学习后训练,成功迁移到非自回归离散掩码扩散模型上。  

在传统的自回归语音模型中,策略梯度更新可以顺理成章地沿着「从左到右」的链式概率分解进行。

然而,Luna-TTS作为一个非自回归掩码扩散模型,是通过多步迭代去噪并行生成音频网格的,无法直接按链式法则计算输出概率。

为了破解这一难题,Luna-TTS成功将 GRPO 迁移到了离散掩码扩散模型上,其核心在于轨迹感知与字典序奖励。

图片

Block Diffusion 与工程落地

为了满足全双工 Agent 和实时交互场景,团队提出了 Luna-TTS Realtime实时语音合成方案。  

图片

在这个过程中,语音不是逐帧生成的,而是切成一个个 1.28秒(32帧) 的小块。块之间采用自回归方式(支持KV Cache加速),块内部则用 8~16步并行去噪 一次生成32帧和8个码本,效率极高。

它的实测性能非常惊艳,在2张H20 GPU 上开启并行CFG部署时,首包延迟(TTFT)只需 41.6毫秒,就能生成并解码出第一个1.28秒的音频块,几乎感觉不到等待。

实时倍率(RTF)低至 0.024,也就是生成1秒语音仅需24毫秒,超过40倍实时速度,完全满足流畅对话需求。

为了让长文本朗读、全双工对话等商业化场景真正跑通,团队在工程侧做了几项关键配套。

比如,他们做了推理同步与显存优化,借助 vLLM-Omni 框架,实现显存解耦和流式Chunk递交,保证长时推理不爆显存、响应平稳。

另外,团队还做了文本正则化:针对特殊符号、数字等「模型容易读错」的文本,构建了一套完善的前端预处理模块,确保无论输入多复杂,模型都能「读得对、读得顺」。

数据工程与真实情感控制

Luna-TTS之所以能在对话听感和表现力上超越 ElevenLabs 等,核心在于百万小时级的极致数据工程与专项退火微调。

首先,在让模型学会「表达情感」之前,团队构建了一个规模高达100万小时的精调多语言语音语料库,涵盖了中文(43.4%)、英文(43.1%)以及日语和韩语(合计 13.6%)。

其次,团队精选出约10万小时的「极高质量」语音子集进行退火训练,极大提高了语音的保真度、鲁棒性和自然韵律。

最后,在第三阶段的训练中,团队引入了带有精细标注的表达性语音数据。

这些标注不光是简单的话语级情绪标签(如 [happy] 开心、[angry] 生气、[sad] 悲伤),更创新性地加入了行内非语言发音标签(NVV),例如 [laughs](笑声)、[sighs](叹息)、[gasps](喘息)、[coughs](咳嗽)等。

图片

这些控制标签不是额外接个模块,而是直接当作文本提示输入给模型,不需要额外的风格编码器或控制头。

这样一来,模型就能在正确的文本位置,自然地带出呼吸、叹息、情绪起伏,听起来更像真人,而不是机械地念稿子。

就这样,Luna-TTS成功在TTS领域实现了「高品质表现力」与「工业级极低延迟」的统一。

它既有情感表现力,又能满足实时场景的低延迟要求,让扩散语音生成到达了新的天花板。


从天使轮到全球第一,小苗从未离场

早在2025年7月,紫竹小苗基金及旗下GP小苗朗程所管理的交大未来小苗基金、小苗朗鲲基金于2025年7月领投了其天使轮,并在天使+轮持续加注,彰显了对公司的高度认可与坚定信心。

小苗朗程:“我们投的不止是一款语音模型,而是团队基于视觉、听觉为输入的多模态交互大模型的持续研发能力。钱教授的学术深度与梅总的商业锐度,正是我们眼中最稀缺的组合。”

从最早的天使轮,到今天的全球第一,小苗始终在场——不是因为看见了成功,而是相信这条路一定走得通。


阅读原文:


全球第一,碾压谷歌!中国版Thinking Machines诞生,语音赛道变天了

Luna-TTS 登顶 Hugging Face TTS Arena,并在 Artificial Analysis 超越谷歌!






#小苗朗程已投企业最新轮次融资报道#

点击项目名称可阅读详情


穹彻智能奥创光子慕帆动力蓝星光域图灵量子跃迁引擎|非夕机器人稷以科技|霖鼎光学|光本位汇像信息清研精准天目智能|聚克流体|弈柯莱天鹜科技邦耀生物意瑞半导体|泓芯半导体|菲镭泰克|清德氢能源|九未实业|云轴科技研视科技介方信息途径信息依柯力翌视科技深视科技赛卓电子唯万密封实朴检测


关于小苗朗程:

上海小苗朗程投资管理有限公司(以下简称“小苗朗程”)成立于2015年,是紫江集团控股的紫竹高新区旗下的创业投资基金管理平台,小苗朗程早期专注于投资以ABCII为代表的新一代信息技术方向与先进制造为代表的新质生产力方向的早中期硬科技公司,近年深耕以生成式人工智能、先进制造与前沿科技赛道为代表的早中期深科技公司,致力于成为国内早中期科技投资“发现价值+服务增值”的先行者。
小苗朗程核心管理团队具有长期创业投资管理及深厚上市公司资本运作经验,投资成功率在创业投资管理机构中名列前茅(截至目前IPO上市20+,并购退出15+)。
截至目前,小苗基金及旗下小苗朗程所管理基金已累计投资穹彻智能、奥创光子、慕帆动力、蓝星光域、图灵量子、跃迁引擎、非夕机器人、松延动力、稷以科技、霖鼎光学、光本位、汇像信息、清研精准、聚克流体、弈柯莱、天鹜科技、邦耀生物、意瑞半导体、泓芯半导体、菲镭泰克、清德氢能源、九未实业、云轴科技、研视科技、介方信息、依柯力、翌视科技、深视科技、赛卓电子、唯万密封(301161)、实朴检测(301228)等160余家科技企业。