双泓科技
基于 NVIDIA Jetson AGX Orin 本地部署

机器人本地多模态交互系统

离线语音 + 本地大模型 + 实时安全审核

面向服务机器人的端侧智能化解决方案。将语音识别、意图理解、大模型对话、语音合成等核心能力全部部署于本地,实现毫秒级响应,保障数据隐私安全,支持展厅导览、企业咨询、智能客服等多场景应用。

六大核心能力

全链路本地化部署,从语音输入到合成输出,端到端延迟控制在 500ms 以内,无需依赖云端网络。

🔊

离线语音识别(ASR)

基于 FunASR 流式解码,支持中英文实时转写,标准语音库识别率 > 98%,每 100ms 输出中间结果,响应延迟 ≤ 300ms。

> 98%识别准确率
≤ 300ms响应延迟
🗣

语音合成(TTS)

基于 Coqui TTS 流式合成,支持多情感语调输出,音色库兼容主流音色,可定制专属品牌声音,合成自然流畅。

流式实时合成
多情感语调控制
🔑

声纹识别

支持不少于 5 个声纹区分,每 400ms 提取帧级特征,通过余弦相似度匹配实现身份识别,支持 VIP 客户专属导览。

≥ 5声纹区分
VIP身份匹配
🤖

本地大模型对话

集成 Qwen 7B 轻量化模型,支持 RAG 知识库增强,记忆深度 ≥ 20 轮,支持 3 人同时交叉对话,上下文自动隔离。

Qwen 7B本地模型
≥ 20轮记忆
🛡

三段式安全审核

输入审核、生成审核、输出审核三层防护,覆盖涉政、涉黄、暴恐、违法犯罪、歧视偏见、个人隐私等风险类别。

3 段审核链路
6 类风险覆盖
💬

全双工打断

支持用户随时打断 AI 语音播报,基于短时能量 + VAD 概率两级判断,精准区分有效打断与背景噪声干扰。

双级优先级判断
100ms打断响应

流式处理架构

VAD → ASR → 安全审核 → LLM → 生成审核 → TTS → 输出审核,全链路流式并行,端到端延迟 < 500ms。

🎤

语音输入

16kHz/16bit
📡

VAD 检测

Silero VAD

ASR 转写

FunASR
🛡

输入审核

安全过滤
🤖

LLM 生成

Qwen 7B
🛡

生成审核

内容合规
🔈

TTS 合成

Coqui TTS
🛡

输出审核

最终过滤
🔊

语音播放

流式输出
< 500ms端到端延迟
80% 本地本地优先处理
20% 云端云端兜底优化
3 段审核全链路安全

应用场景

覆盖企业展厅、公共服务、商业咨询、智能导览等多种场景,为服务机器人赋予自然语音交互能力。

企业展厅咨询
01

企业展厅咨询

企业成立时间、规模、业务介绍;特定展品讲解(参数、技术优势、应用案例),支持单轮询问和多轮追问。

智能信息查询
02

智能信息查询

展厅开放时间、洗手间与休息区位置、周边餐饮与停车信息,通过自然语音对话即时获取。

VIP 专属导览
03

VIP 专属导览

通过声纹识别验证 VIP 客户或企业员工身份,自动匹配专属导览路线与个性化讲解内容。

语音控制机器人
04

语音控制机器人

语音指令触发技能动作(猜拳、握手、点赞、比心、比耶、恭喜、碰拳、自我介绍等),可自定义扩展。

开启智能交互体验

立即体验机器人本地多模态交互系统,感受毫秒级响应的自然语音对话

立即体验