边缘端离线
把核心模型、知识库与业务规则放在本地网关或端侧节点,适合门店、校园、客房等弱网场景。
- 断网可用,响应稳定
- 增量包 OTA 更新
- 敏感数据优先本地处理
每一种部署形态都保留同构接口:先离线小规模试点,再迁移到区域云或混合架构,不需要推翻设备端能力。
把核心模型、知识库与业务规则放在本地网关或端侧节点,适合门店、校园、客房等弱网场景。
按国家或大区建立服务节点,让设备、语音与模型调用在区域内闭环,降低跨境链路风险。
端侧负责低延迟语音与常用指令,云端承接复杂问答、知识库检索与统一运营分析。
语音识别、语义编排、业务网关、知识库检索、LLM 推理与设备管控都可拆分交付。客户可以选择全本地、私有云或混合模式,也可以保留 OpenAI 兼容接口用于后续模型切换。
出海项目的关键不是“能跑起来”,而是客户团队能持续维护。我们会把安装、监控、更新、权限和日志一起纳入交付范围。
支持 K8s、Docker Compose 与离线安装,便于部署在客户机房、私有云或区域节点。
内置设备状态、调用链路、模型响应与关键错误日志,方便定位现场问题。
支持按国家、客户、门店、设备批次进行策略下发,降低跨区域版本风险。
可按目标市场配置语言、时区、隐私文案、业务词库与售后交付材料。
Related · 相关方案
私有化部署不只是把服务器换到客户环境里。边缘、区域云和混合云适合不同的业务规模、数据边界和运维方式,前期选错会抬高后续成本。
适合门店、园区、工厂、政企内网等对数据边界敏感的场景。
适合集团按区域管理设备、模型、知识库和运维策略。
兼顾合规、成本和模型能力,适合逐步扩张的项目。
判断维度:① 数据敏感度(高 → 边缘端 / 区域云);② 实时性要求(200ms 以下 → 边缘端 / 端云混合);③ 算力规模(小 → 边缘,大 → 区域云);④ 网络稳定性(弱 → 边缘)。常见组合:发达国家用端云混合,中东/非洲优先边缘端,欧盟金融/政府用区域云。
Jetson Orin Nano 8GB 可跑 7B 参数模型(int4 量化),延迟 ~300ms;Jetson AGX Orin 64GB 可跑 13-32B(int4 / int8);NPU 加持的国产芯片(昇腾 / 寒武纪)跑 7B 模型可达 150ms。具体选型告诉我们应用场景,我们给方案。
vLLM(云端首选,吞吐高)、TensorRT-LLM(NVIDIA 全栈最优)、llama.cpp(边缘端首选,跨平台)、ONNX Runtime、TGI、SGLang;我们也支持 OpenAI 兼容协议适配企业自研推理服务。
提供 Docker 镜像 + Helm Chart + Terraform 模板:客户的 K8s 集群(自建 / GKE / EKS / AKS / 阿里云 ACK)一键部署;监控走 Prometheus / Grafana;日志走 ELK / Loki;CI/CD 集成 GitHub Actions / GitLab CI。
边缘端模式:完全无影响,所有语音 / NLP / LLM 推理本地完成;端云混合:本地兜底简单意图(如设备控制、本地知识库问答),复杂问答暂时降级提示「等网络恢复再说」;区域云模式:会中断,但可加 4G/5G 备份链路。