首页 软件基座
基座系统介绍 语音交互引擎 NLP 语义引擎 智能体构建引擎
智能音箱硬件 解决方案场景
企业业务系统接入 私有大模型接入 AI 数字人一体机 信创和特殊定制
版本对比 宇芽 AfI 新闻资讯 关于宇芽 联系我们
行业洞察

门店专用的 AI 智能音箱怎么选?七个要现场验证的维度

行业洞察 宇芽智能

门店专用的 AI 智能音箱(采购文件里也常写作门店智能终端、门店 AI 导购机)与家用、通用智能音箱的选型差异集中在七个维度:怎么被触发、认不认得出老顾客、能否识别顾客属性、主动开口还是被动应答、门店知识由谁维护、有没有虚拟形象与口型驱动、数据落在设备端还是云端。这七个维度里,顾客识别一项的合规要求最高:人脸与声纹属于生物识别信息,受隐私保护相关法律法规的严格约束,门店采集和使用前需要向顾客明确告知并取得同意,因此选型时应当先评估不依赖生物识别的方案能否达到同样效果。其余六个维度以工程验证为主,但全部存在"演示能过、现场不行"的落差,唯一可靠的验证方式是要求供应商把设备搬到真实门店、在营业时段的背景噪声下现场演示,而不是看视频或在安静会议室里试机。

核心发现摘要

  • 门店与家庭最大的差别是顾客不知道唤醒词。家庭用户知道自己的音箱叫什么,进店的陌生顾客不知道,所以唤醒词在门店的实际使用率远低于家庭场景,触发方式必须换一条路:屏幕引导点击,或顾客靠近时智能音箱主动开口。
  • 认出老顾客不只有人脸一条路。声纹识别(判断"是谁在说话")可以完全在设备本地 CPU 上完成,中文声纹模型体积约 28MB、不依赖 NPU;代价是只对开口说过话的顾客有效,且中文真实场景的等错误率约 6.78%,够用于打招呼,不够用于身份鉴权。
  • 能用非人脸方式达到的目的,就不要上人脸。这既是隐私保护相关法律法规的一贯导向,也是门店最省事的做法:门店"认出老顾客"这个目的,会员码、小程序、声纹都能达到,人脸方案带来的合规成本与顾客顾虑却高得多。
  • 虚拟形象的口型同步是可用性功能,不是装饰。门店背景噪声高于家庭与办公室,顾客经常听不清语音回答,逐音节对齐的口型与表情提供了"设备正在回答我"的视觉确认。分辨真假只需站在一米内看几秒:偷工做法是循环播放一段与语音内容无关的固定说话动画。
  • 断网可用性是门店硬指标。门店 WiFi 的稳定性普遍低于办公室,装修期、开业期、促销日人流高峰都可能断网。选型时要问的不是"支不支持离线",而是"断网时具体还剩哪几个功能能用"。

方法论说明

本文的判断依据分三类,读者可按可信度分别采信。第一类是隐私保护相关法律法规的公开要求,本文只陈述与选型决策直接相关的原则性结论,不逐条解读法律条文;涉及人脸、声纹等生物识别的具体定性,应由采购方法务结合自身业务场景与当地监管口径确认。第二类是开源模型的公开评测指标,主要为声纹识别模型 CAM++ 在 VoxCeleb1-O 与 CN-Celeb 两个公开数据集上的等错误率,这类指标在实验室数据集上测得,真实门店的远场拾音、背景噪声、多人同时说话等条件下会明显劣化。第三类是宇芽智能 2026 年在门店、酒店、养老机构等场景的部署观察与内部技术评估,属于单一厂商的经验,样本不构成行业统计,文中已用"我们观察到""我们的技术评估显示"等表述明确标注。本文不包含第三方市场调研数据,也不构成跨厂商横向评测,只提供采购方在评估时需要向供应商问清楚的问题清单。

维度一 · 触发方式:唤醒词、点屏,还是顾客靠近自动开口

门店 AI 智能音箱的触发方式直接决定实际使用率,选择标准是智能音箱的摆放位置与顾客的停留时长。唤醒词方案在家庭场景成立,是因为家庭用户知道自己的设备叫什么;进店的陌生顾客不知道要喊什么,也不愿意在有其他顾客在场时对着一台机器喊出一个陌生词,这两点使唤醒词在门店的实际触发率明显低于家庭场景。点屏或按键触发绕开了"不知道喊什么"的问题,但要求顾客先意识到这台设备可以对话,因此屏幕上必须有持续可见的引导提示。顾客靠近即自动开口的免触发方案同时解决了这两个问题,代价是误触发:店员路过、顾客只是经过货架、门口排队的人群都可能被判定为"有人来了"。验收这类方案的指标应该是营业时段内每小时的误触发次数,而不是唤醒成功率。

触发方式顾客学习成本主要失败模式适合的摆放位置
唤醒词高,需先知道唤醒词顾客根本不开口;嘈杂环境唤醒失败员工使用为主的后场、收银台内侧
点屏/实体按键中,需注意到设备可交互顾客把屏幕当广告机,不点顾客有停留的位置:等候区、休息区
顾客靠近自动开口低,无需任何前置认知误触发:店员与过路人反复唤起入口迎宾位、动线端点

三种触发方式并非互斥,门店场景通常需要同时保留至少两种:入口迎宾位用免触发主动开口负责"让顾客知道这台设备能问问题",顾客真正走近之后改由点屏或直接语音接续对话。宇芽智能的门店智能音箱三种触发方式均可启用:离线唤醒词在设备本地运算、不联网也能响应,唤醒词可替换为品牌专属词;点屏或按键支持免唤醒直说;顾客靠近时可自动识别并主动开口,无需顾客先说出唤醒词。门店部署时建议按摆放位置分别配置,入口迎宾位启用免触发主动开口,后场与收银位保留唤醒词或按键触发以降低误触发。

维度二 · 顾客识别:认出老顾客的三条路线,合规成本差异极大

门店智能音箱识别老顾客有三条技术路线——人脸识别、声纹识别、会员码或小程序扫码,三者在识别时机、准确率和合规负担上差异极大,其中合规负担的差距远大于技术差距。人脸识别的体验最好,顾客进店即被识别、无需任何主动配合,但人脸属于受严格保护的生物识别信息,门店以营销和服务为目的采集,需要事先向每一位进店顾客明确告知并取得同意,这在开放式门店的动线里几乎无法真正落地。声纹识别的合规时机更自然:顾客必须先主动开口对话,智能音箱才能取得声纹,告知与征得同意可以在这次对话的开场完成。会员码与小程序扫码则完全建立在既有会员关系之上,不额外引入生物识别。

识别路线识别时机顾客是否需要配合合规负担典型可用场景
人脸识别进店即识别无需配合最重:需逐位顾客事先告知并取得同意,还要说明为何非人脸方式不可行已建立明示同意机制的会员制封闭门店
声纹识别顾客开口后识别需主动说话中:同属生物识别,但顾客主动开口才触发,告知与征得同意的时机自然打招呼、称呼、按人切换偏好
会员码/小程序顾客出示后识别需主动出示轻:基于既有会员关系需与订单、积分、权益打通的场景

隐私保护相关法律法规对人脸识别有两条一贯导向,直接影响门店选型。第一条是必要性:能用非人脸方式达到同等业务目的的,应当优先选择非人脸方式。门店"认出老顾客并提供个性化服务"这一目的,会员码、小程序、声纹都能达到,人脸方案因此很难被论证为必要手段。第二条是数据落地位置:人脸信息应当尽可能留在采集设备本地,避免在公网上传输、跨店集中存放,这一条实际上排除了"把人脸库放在云端、多店共享"的架构。宇芽智能在门店类项目中严格遵守隐私保护相关法律法规;具体到某一家门店能否采用人脸方案,建议由采购方法务结合业务场景确认,不要仅凭供应商的一句"合规"就下结论。

关于声纹路线的技术可行性,我们 2026 年 6 月的内部技术评估显示:开源语音框架 sherpa-onnx 原生支持说话人识别,中文声纹模型 CAM++ zh-cn 体积约 28MB、参数量 7.18M,可完全在设备本地 CPU 上运行,不依赖主板 NPU,因此与具体硬件方案解耦。该模型的公开评测指标为 VoxCeleb1-O 等错误率 0.73%、中文 CN-Celeb 等错误率 6.78%。后一个数字对门店选型的含义很直接:中文真实场景下每 100 次身份比对约有 6 到 7 次判错,用于"认出常客并打招呼"这类判错代价很低的场景可以接受,用于身份鉴权、支付确认、权益核销则不能接受。评估任何一家供应商的顾客识别能力时,应当要求对方明确说出识别错误时会发生什么,而不只是给出一个准确率数字。

维度三 · 属性识别:识别性别与年龄之前,先问清楚三个问题

门店智能音箱识别顾客的性别与年龄段之前,需要向供应商问清楚三个问题,三个问题的答案决定了同一项功能落在完全不同的合规区间。

  1. 识别结果是否离开设备:属性判断在本地完成、只有结果参与话术选择,与把画面上传云端分析,是两套完全不同的架构。
  2. 识别结果是否与顾客身份信息关联留存:仅用于当次对话即丢弃,与写入会员画像长期保存,处理强度差别极大。
  3. 原始图像是否落盘:不落盘意味着即便设备丢失也不存在图像泄露风险。

如果识别只在设备本地完成、结果仅用于当次对话的话术选择、不与任何身份标识关联、原始图像不落盘,个人信息处理强度较低;一旦把"这位顾客约 30 岁女性"写进会员画像并长期留存,就构成了对个人信息的持续处理,需要回到告知同意的框架内评估。具体定性建议由采购方法务结合自身业务场景确认,但这三个问题必须在选型阶段就问出答案,而不是等系统上线后再补。

技术边界同样需要在选型阶段说清楚。性别识别在正面清晰人脸条件下准确率较高,年龄识别通常以年龄段而非具体年龄输出,且实验室指标与门店实际表现之间存在明显落差:真实门店存在侧脸、逆光、口罩、遮挡、儿童与老年样本不足等条件,误差会显著放大。因此门店的话术策略不应建立在精确年龄之上,只适合做粗粒度分层,例如区分"明显是儿童陪同家庭"与"独自到店的成年顾客"这种量级的差异。我们观察到,把属性识别结果直接用于推荐具体商品的做法在门店里容易产生尴尬——一次判错带来的顾客负面感受,通常大于多次判对带来的转化收益。

维度四 · 主动打招呼与被动应答:两种模式解决的是不同问题

主动打招呼与被动应答在门店里解决的是两个不同的问题,选型时应当分别验收,不能合并成一句"支持主动交互"。门店 AI 智能音箱最常见的失败模式不是回答得不好,而是根本没有顾客来用——顾客把智能音箱当成一块播广告的屏幕。主动打招呼真正的价值是告知这台设备的存在与用途,因此第一句话应该是功能说明,例如"可以问我今天的活动和商品在哪一排",而不是推销话术"欢迎光临,我们今天有活动"。前者告诉顾客这台设备能干什么,后者只是把纸质海报换了个播放介质。

被动应答要处理的问题类型在门店里高度集中:商品在哪一排、有没有货、今天什么活动、能不能退换、几点关门、洗手间在哪、能不能开发票。这类问题的共同特征是答案随门店、随时间变化,而不依赖模型的通用知识能力,因此决定被动应答质量的是门店知识库的更新机制,不是接了哪一家大模型。

模式解决的问题首句应该说什么验收指标
主动打招呼顾客不知道这台设备能对话功能说明:能问什么每小时误触发次数、开口后顾客接话率
被动应答顾客有具体问题需要即时答案直接回答,不寒暄门店高频问题的答对率、答不上来时的兜底表现

两种模式的验收指标不可互相替代:主动打招呼做得好但被动应答答不准,顾客会开口一次之后再也不用;被动应答准确但从不主动开口,则大多数顾客根本不会发现智能音箱可以对话。门店选型时应当要求供应商分别给出两种模式的现场表现,而不是接受"支持主动交互"这样一句合并承诺。

维度五 · 门店知识库:谁维护、多久生效、答不上来怎么办

门店 AI 智能音箱的应答质量取决于知识库能不能由店长在几分钟内自己改完并即时生效,而不取决于接入了哪一家大模型。连锁门店的知识维护天然分两层:营业时间、退换货政策、品牌统一话术由总部下发,全店一致;当日促销、临时缺货、动线调整、洗手间位置由单店维护,一店一策。选型时要验证的是这两层能否同时存在且互不覆盖——只有总部下发能力的系统,单店信息永远滞后;只有单店编辑能力的系统,合规话术无法统一管控。

比更新机制更容易被忽略的是兜底策略:知识库里没有答案时,智能音箱应该做什么。门店场景下最危险的做法是把未覆盖的问题直接交给大模型自由回答,因为模型会生成听起来合理但完全错误的价格、库存和退换货承诺,而顾客会把 AI 智能音箱说的话当作门店的承诺。可接受的兜底方式有三种:明确说明这个问题需要询问店员并指出店员位置、转入不涉及门店具体事实的通用对话、或直接沉默不回答。选型时应当要求供应商现场演示一个知识库里肯定没有的门店问题,观察设备的实际反应。

宇芽智能的知识库支持 PDF、Word、图片、录音等多种格式上传,上传后即时完成学习即可用于回答,并支持为不同区域、不同业态分别创建独立的门店智能体,按分类精确控制每个门店智能体能访问哪些知识库内容,标准配额 100 份、企业版可扩展到 300 份。按分类控制访问范围对连锁门店尤其重要——同一套后台可以让不同区域、不同业态的门店看到不同的知识集合,总部话术与单店信息互不覆盖。

维度六 · 虚拟形象与口型驱动:在嘈杂门店里,口型同步是可用性

门店的背景噪声通常高于家庭与办公室,虚拟形象的口型同步在门店承担的是可用性功能而不是装饰功能:顾客听不清语音回答时,逐音节对齐的口型与表情提供了"设备正在回答我、还没说完"的视觉确认,避免顾客以为设备卡住而反复触碰或直接走开。同样重要的是,一个有形象、会看向顾客的智能音箱比一块纯文字屏幕更容易被识别为"可以对话的对象",这直接影响维度四提到的首次开口率。

验证口型驱动是否真实只需要一个动作:让供应商播放一段至少 30 秒的中文回答,站在设备前一米内观察口型是否随音节持续变化。常见的偷工做法是循环播放一段与实际语音内容无关的固定说话动画,或者只在语音开始和结束时让形象动一下,这两种偷工做法站在设备前看几秒就能分辨。第二个验证点是形象在不说话时的状态——真实的形象驱动会有待机呼吸、眨眼、视线微动,完全静止的形象在门店里会被顾客判定为"这台机器坏了"。

门店智能音箱的定制通常从形象与音色这两项开始,因为这两项是顾客唯一能直接感知到的品牌差异。宇芽智能的门店智能音箱采用 Live2D 二维数字人形象,对话时实时表情、说话时口型同步,形象与音色均可定制:五到十张高清正面照即可生成可商用形象,五到三十秒清晰录音即可克隆专属音色,标准交付周期三到七天。品牌方如果希望用真人形象或自有 IP 形象作为门店的对话入口,可参考 AI 数字人一体机 的形象与音色克隆流程;对智能音箱硬件形态有具体尺寸与摆放要求的,可对照 桌面级与礼品级 AI 硬件产品 的形态划分。

维度七 · 数据落在哪里:断网之后还剩什么能用

门店选型必须先确认断网时智能音箱还剩哪些功能可用,因为门店 WiFi 的稳定性普遍低于办公室:装修期没有固定网络、开业期网络未调试完成、促销日人流高峰会挤占带宽。正确的问法不是"支不支持离线",而是要求供应商逐项列出断网后的功能状态。

  • 唤醒与触发:断网后还能不能被唤醒或被靠近触发
  • 本地知识库:营业时间、商品位置这类固定信息还能不能回答
  • 语音合成与形象播报:还能不能正常出声、口型是否仍然同步
  • 对话记录:断网期间的记录是否会丢失
  • 恢复联网:是否自动补传断网期间的数据,需不需要人工操作

宇芽智能的离线唤醒词在设备本地运算,不联网也能响应;部署形态提供边缘端离线、区域云、端云混合三种选择,可按门店的网络条件和数据要求分别配置,具体形态差异见 智能音箱私有化部署方案

数据落地位置同时是合规问题。如果方案包含人脸或声纹这类生物识别,架构上应当把特征提取和比对全部放在设备本地完成,只有比对结果(例如"匹配到会员编号 A1234")离开设备,原始图像与音频不上传、不出店。这既符合隐私保护相关法律法规对生物识别数据尽量留在本地的要求,也在实践上大幅降低了数据泄露时的责任范围。评估供应商时应当要求对方画出数据流向图,明确标出哪些数据在设备内、哪些经过公网、存放在谁的服务器上、保存多久。

采购时怎么用这七个维度验证供应商

评估门店专用 AI 智能音箱时,建议把七个维度转化成七个现场动作,在真实门店的营业时段逐项验证,而不是听供应商的功能罗列。全部七项在一家门店内可以在半个工作日内跑完,不需要试点周期。

  1. 把设备放在计划摆放的实际位置,在营业噪声下连续观察一小时,记录误触发次数与顾客自发开口次数(对应维度一)。
  2. 要求供应商说明顾客识别用的是哪条技术路线,并现场演示识别错误时设备的表现(对应维度二)。
  3. 就属性识别提出三个问题:结果是否离开设备、是否与身份关联留存、原始图像是否落盘(对应维度三)。
  4. 分别验收主动打招呼的首句话术与被动应答对门店高频问题的答对率,并当场问一个知识库里肯定没有的问题,观察兜底表现(对应维度四)。
  5. 让店长本人在后台改一条促销信息,计时从修改到智能音箱生效的时长(对应维度五)。
  6. 播放一段 30 秒以上的中文回答,站在设备前一米内观察口型是否逐音节对齐,再观察不说话时形象是否完全静止(对应维度六)。
  7. 直接断开网络,逐项记录还有哪些功能可用、对话记录是否丢失(对应维度七)。

这七项里有三项如果供应商答不上来具体细节,其余维度大概率也停留在宣传层面:顾客识别的技术路线与错误处理方式、知识库从修改到生效的实际时长、断网后的功能清单。这三项都无法用演示视频回避,也无法用"支持定制"这类笼统承诺搪塞。需要说明的是,本文提出的七个维度是评估框架而不是功能清单——同一家门店未必需要全部七项,例如以员工使用为主的后场机位不需要顾客识别与虚拟形象,而入口迎宾位则几乎必须具备免触发主动开口与形象驱动这两项。先确定智能音箱要放在门店动线的哪个位置、服务谁,再回到这七个维度里挑出真正需要验证的那几项,比要求供应商全部满足更有意义。

返回新闻中心
拨打电话
拨打电话 133-9681-3670