很多企业的现状是这样的——
技术或运营团队在 Dify(一款开源 + 商业混合的 LLM 应用开发平台)上搭好了一个企业智能体:角色提示词写好了、知识库上传了、工作流调通了、API 也开放出来了。
然后这个智能体只在 PC 上跑——员工要打开浏览器登录、客户要走小程序入口——离真实业务场景隔着一层。
怎么把这个智能体落到员工 / 客户开口就能用的物理终端上?这就是本篇要回答的问题。
下面的流程把"如何接入" 完整拆解。
准备工作:你需要确认的 3 件事
接入开始之前,先确认这 3 件事——任何一件缺失都会导致接入卡住:
- Dify 智能体已经能从 API 正常调用(不论是 Dify Cloud 还是私有部署)
- 拿到了智能体的 App API Key(在 Dify 工作台的"API Keys" 菜单生成)
- 接通方的硬件——一台能听会说的企业级桌面对话音箱
宇芽智能(BITSEED)提供的桌面对话音箱已经支持 Dify 接入。下面以宇芽方案为例展开。
步骤 1:在 Dify 工作台准备好智能体
Dify 工作台上需要确认的几件事——
1.1 角色提示词的"业务场景化"
很多团队上线时角色提示词比较通用,比如"你是 XX 公司的助手"。落到桌面音箱场景里,需要把角色细化到具体业务里:
- 「你是 XX 公司客户服务等候区咨询助理。语气专业、不催促、不替专员做承诺。涉及具体价格 / 合同 / 个性化方案,统一引导客户与 XX 专员确认。」
角色越具体,对话越稳。
1.2 知识库的"分层组织"
Dify 的知识库支持分文件夹 / 标签管理。落到业务场景后建议这样分:
- 机构层:品牌信息、地址、营业时间、组织架构
- 业务层:产品 / 服务的标准介绍、流程说明
- 客户层(可选,仅对配置过个人化场景需要):每位客户的服务档案
1.3 边界禁区写进 system prompt
行业不同,禁区不同——医美 / 房地产 / 金融 / 4S 店等行业各自的合规边界都要明确写进角色提示词。这一步必须前置,不能"上线后补"。
步骤 2:在桌面音箱后台填入接入凭据
设备这边的接入过程极简——
- 登录宇芽对话音箱的设备配置后台(浏览器即可)
- 在「智能体接入」一栏选择「Dify」作为接入平台
- 粘贴 Dify 工作台生成的 App API Key
- (可选)填入 Dify 的 API Endpoint URL(如果是私有部署而非 Dify Cloud)
- 保存
完成。后台会自动做一次连通性测试,绿灯亮起即接通成功。
整个过程通常 3-5 分钟、不需要写一行代码。
步骤 3:选硬件 + 部署到目标位置
选硬件:根据场景选合适的形态——
场景推荐硬件桌面 / 沙发茶几 / 床头7 寸桌面智能屏销售工位 / 销售厅展示10 寸 / 15 寸大屏桌面摆件 / 文创 / IP 形象桌面智能音箱
宇芽方案支持按业务场景选合适型号——不是"一款打天下"。
部署到位置:每台设备拿到手就能用——开机自检 + 配置后台同步配置 + 唤醒词测试 → 全部 OK 后摆到目标位置即可。
接入后的真实对话体验
举几个典型对话场景:
客户在等候区 客户:「你们的 XX 服务流程是怎么样的?」 设备:根据 Dify 智能体的知识库回应,配合机构合规口径的边界。
客户问个性化问题 客户:「我这种情况适不适合 XX?」 设备:「这件事涉及具体判断,建议跟我们的 XX 专员沟通。我已经帮您备注了。」
客户提价格 / 合同问题 设备:统一引导到对应负责人,不做任何承诺。
整个体验取决于 Dify 智能体本身的质量——桌面音箱只是把 Dify 智能体的对话能力,搬到了员工 / 客户开口就能用的物理位置上。
部署时的几个建议
关于响应延迟 Dify 工作流如果挂了多个节点(意图识别 → 知识库召回 → 模型推理 → 内容审核),每个节点都有耗时。建议在 Dify 工作台用 lite 档位模型做"判断 + 分类" 节点,复杂推理节点保留 pro 档——可以让单次响应快一档。
关于流式输出 Dify 支持流式 API 调用。建议在宇芽设备配置后台开启流式接收 + 流式 TTS 播报——客户能在 1 秒内听到第一句话,体感等待时间大幅缩短。
关于私有部署 Dify 如果企业的 Dify 是私有化部署在内网,需要确保设备能访问内网 API(同 VPN / 内网穿透 / API 网关都行)。这部分我们的工程团队可以一起对接。
关于多智能体切换 一家企业可能在 Dify 上搭了多个智能体(如"客户咨询助理"、"内部知识查询助理"、"招聘问答助理")。我们支持在同一台设备上按场景或角色切换不同智能体,不需要每台设备绑定一个。
落地成本
很多企业第一次接触"AI 智能音箱方案"的反应是"很贵"。
实际上——一套完整方案(音箱 + 配套系统)落地只要几千元。完全可以从单台样机做 PoC 起步:先在一个场景放一台,观察使用频次、客户 / 员工的真实反馈,验证完了再放量。
写在最后
Dify 上搭好的智能体不应该停在浏览器里——把它接到一台能听会说的桌面对话音箱里,对话能力立刻覆盖到"用户面前不一定有屏幕" 的所有物理场景。
接入过程不需要技术开发、不需要等 SDK、不需要让 Dify 团队做适配。只要 Dify 工作台生成的 App API Key、加一台宇芽桌面对话音箱,3-5 分钟就能跑通。
如果你也在做 Dify 智能体的物理化落地,欢迎联系我们。
宇芽智能(BITSEED) · 企业级 AI 智能音箱定制方案商 · 主流智能体平台均已验证可接入 · 最快 3 天接入。