core capabilities
六大核心能力
全链路本地化部署,从语音输入到合成输出,端到端延迟控制在 500ms 以内,无需依赖云端网络。
🔊
离线语音识别(ASR)
基于 FunASR 流式解码,支持中英文实时转写,标准语音库识别率 > 98%,每 100ms 输出中间结果,响应延迟 ≤ 300ms。
> 98%识别准确率
≤ 300ms响应延迟
🗣
语音合成(TTS)
基于 Coqui TTS 流式合成,支持多情感语调输出,音色库兼容主流音色,可定制专属品牌声音,合成自然流畅。
流式实时合成
多情感语调控制
🔑
声纹识别
支持不少于 5 个声纹区分,每 400ms 提取帧级特征,通过余弦相似度匹配实现身份识别,支持 VIP 客户专属导览。
≥ 5声纹区分
VIP身份匹配
🤖
本地大模型对话
集成 Qwen 7B 轻量化模型,支持 RAG 知识库增强,记忆深度 ≥ 20 轮,支持 3 人同时交叉对话,上下文自动隔离。
Qwen 7B本地模型
≥ 20轮记忆
🛡
三段式安全审核
输入审核、生成审核、输出审核三层防护,覆盖涉政、涉黄、暴恐、违法犯罪、歧视偏见、个人隐私等风险类别。
3 段审核链路
6 类风险覆盖
💬
全双工打断
支持用户随时打断 AI 语音播报,基于短时能量 + VAD 概率两级判断,精准区分有效打断与背景噪声干扰。
双级优先级判断
100ms打断响应
architecture
流式处理架构
VAD → ASR → 安全审核 → LLM → 生成审核 → TTS → 输出审核,全链路流式并行,端到端延迟 < 500ms。
🎤
语音输入
16kHz/16bit📡
VAD 检测
Silero VAD✏
ASR 转写
FunASR🛡
输入审核
安全过滤🤖
LLM 生成
Qwen 7B🛡
生成审核
内容合规🔈
TTS 合成
Coqui TTS🛡
输出审核
最终过滤🔊
语音播放
流式输出< 500ms端到端延迟
80% 本地本地优先处理
20% 云端云端兜底优化
3 段审核全链路安全
scenarios



应用场景
覆盖企业展厅、公共服务、商业咨询、智能导览等多种场景,为服务机器人赋予自然语音交互能力。

01
企业展厅咨询
企业成立时间、规模、业务介绍;特定展品讲解(参数、技术优势、应用案例),支持单轮询问和多轮追问。

02
智能信息查询
展厅开放时间、洗手间与休息区位置、周边餐饮与停车信息,通过自然语音对话即时获取。

03
VIP 专属导览
通过声纹识别验证 VIP 客户或企业员工身份,自动匹配专属导览路线与个性化讲解内容。

04
语音控制机器人
语音指令触发技能动作(猜拳、握手、点赞、比心、比耶、恭喜、碰拳、自我介绍等),可自定义扩展。
开启智能交互体验
立即体验机器人本地多模态交互系统,感受毫秒级响应的自然语音对话
立即体验