首页 软件基座
基座系统介绍 语音交互引擎 NLP 语义引擎 智能体构建引擎
智能音箱硬件 解决方案场景
企业业务系统接入 私有大模型接入 AI 数字人一体机 信创和特殊定制
版本对比 宇芽 AfI 新闻资讯 关于宇芽 联系我们
Voice Engine · 端侧语音引擎

端侧语音引擎,
隐私不出端、云费用为零

降噪、唤醒、识别、合成——四大模块全栈跑在终端本地。可选离线 / 离在线混合模式,多语种、可定制发音人,把"对话"这件事的成本与延迟都压到极致。

30+支持语种
<800 ms端到端响应
¥0云端推理费
4端侧语音模块
01 · Four Modules

从一句话被听见,
到一句话被回复——四步走完

从环境噪声中拾取人声、唤醒终端、把语音转成文本、再把文本播报回去——四个环节都在端侧跑,不依赖云、也不上传录音。

  • 01
    降噪引擎 (NS)

    波束成形 + 深度学习降噪,远场拾音也能保留人声细节。

  • 02
    唤醒引擎 (KWS)

    自定义唤醒词、低误唤醒、毫秒级响应——可挂起,无需联网。

  • 03
    识别引擎 (ASR)

    端侧实时转写,支持中英混读、方言、专业领域热词。

  • 04
    合成引擎 (TTS)

    自然韵律 + 可定制音色,支持流式合成,秒级出声。

Yuya AI · Voice Pipeline
Step 01

降噪

NS · 远场拾音

Step 02

唤醒

KWS · 自定义词

Step 03

识别

ASR · 实时转写

Step 04

合成

TTS · 流式播报

本地 全链路端侧执行 · 录音 / 文本 / 模型权重不上传云
02 · Multi-Lingual

投放到哪里,就听得懂哪里的话

主流语种与方言全覆盖,字符墙下面是各自对应的 ISO 编码。没看到的语种欢迎询问。

你好zh · cn
Helloen · us
こんにちはja · jp
안녕하세요ko · kr
Holaes · es
Bonjourfr · fr
مرحباar · sa
Olápt · br
Xin chàovi · vn
สวัสดีth · th
Haloid · id
Здравствуйтеru · ru
03 · Edge vs Cloud

三年算总账,端侧便宜得离谱

不是噱头——把云端 ASR / TTS 的调用费摊到 5000 台终端的三年生命周期里,差距就是真金白银。

Yuya · 端侧

本地引擎

¥0/ 设备 / 月(推理费)
  • 全链路本地,无云端调用
  • 不上传录音,隐私不出端
  • 无网络也能用
  • 一次集成,长期免费
Cloud · 云端

云服务模式

¥30-100/ 设备 / 月(保守估算)
  • 按调用量付费,量越大成本越高
  • 录音上传,存在合规风险
  • 网络抖动 = 服务中断
  • 三年合计可达 ¥1080-3600 / 设备
04 · Custom Voice

让贵司的 AI,说出贵司的声音

系统音色任选,也可上传 30 秒录音克隆"专属音色"——让客户一开口就听出来:这是贵司的 AI。

System · Female

企业形象女声

温暖 / 专业 / 俏皮等多种性格音色,10+ 系统女声任选试听。

System · Male

企业形象男声

沉稳 / 朝气 / 磁性等多种性格音色,8+ 系统男声任选试听。

Clone · Custom

音色克隆

30 秒清晰录音即可克隆——创始人、品牌代言、内部 IP,AI 都能"用他的声音"说话。

Start

把语音这件事,一次性做对

试听音色、评估语种、做端侧 POC——都欢迎聊聊,平均 1-2 个工作日给出方案。

Voice Engine Proof

端侧语音的价值,是降低延迟、成本和隐私风险

语音页应给出可感知指标:响应速度、离线可用、语种覆盖、发音人定制和云端调用成本。

低延迟
本地唤醒与前处理

唤醒、降噪、打断等能力尽量在端侧完成,让交互更自然。

低成本
减少云端推理费

高频固定指令和简单语音能力不必每次都调用云服务。

可定制
发音人 / 唤醒词 / 语种

品牌可定义自己的声音、名称和本地化语音体验。

FAQ · 语音交互引擎

语音交互引擎常见问题

端侧语音和云端语音有什么区别?

端侧语音引擎在设备本地完成 ASR/TTS/降噪/唤醒全流程,无需联网,延迟低于 200ms 且零云推理费;云端方案虽然首次部署便宜,但每次对话产生云调用费(一般 ¥30-100/设备/月),三年总成本通常高出 5-10 倍。

宇芽语音引擎支持哪些语种?

目前支持 30+ 语种 ASR(含中、英、日、韩、法、德、西、葡、泰、印尼、越南、阿拉伯等),40+ 语种 TTS。可按客户出海目标国家追加训练。

音色克隆需要多少样本?版权如何保障?

5-10 分钟清晰录音即可克隆出可商用音色;模型默认部署在私有环境,原始样本不出域;要求合同明确授权对象(本人或已获书面授权的第三方),避免侵权。

唤醒词定制流程是怎样的?

提供 3-5 字(中文)或 3-5 syllable(英文)的目标唤醒词;我们采集 / 合成训练数据、训练 KWS 模型、灰度部署到设备;常规周期 1-2 周。

可以离线 + 在线混合部署吗?

可以。常见配置:唤醒 + ASR + 简单指令在端侧执行(保证 200ms 内响应),复杂语义、LLM 推理走云端;网络断开时降级到端侧本地知识库。

拨打电话
拨打电话 133-9681-3670