端侧大模型 × 实时数字人AIBOX PRO 让 AI 回答真正“看得见、听得到”声明本文基于 AIBOX PRO 端侧 AI 一体机的实测 Demo 整理仅做技术方案解析非商业推广。 一句话导读AIBOX PRO 在本地成功跑通Web 大模型调用、VLM 图片识别与 Digital Man 实时数字人完成从“文字 / 图片输入 → 端侧模型推理 → 数字人语音播报 画面呈现”的完整链路验证。大模型推理与音视频处理由不同计算模块独立承担、并行协作在一个盒子内完成从“感知、思考”到“表达”的全过程。 视频完整交互链路演示AIBOX PRO 端侧大模型 × 实时数字人演示视频展示了在 AIBOX PRO 上通过 Web 页面与数字人进行文字问答、图片识别并由数字人流式播报回答的全过程时长 02:57。 一、为复合型 AI 任务而生的异构架构AIBOX PRO 采用双核心板模组 异构计算设计不同核心模组可以独立工作并根据任务特点进行分工模组平台职责 主控Core-3588JD4系统控制、应用服务、音视频处理、常规 AI 推理⚡ AI 协处理模块 ARK1828RKLLM3 大模型推理LLM / VLM AI 协处理模块 BRK1828当前 Demo 未占用可扩展 ASR / 多路分析 / 其他并行模型1.1 Core-3588JD4 主控能力集成 ARM Mali-G610 MP4 四核 GPU内置 6 TOPS NPU支持主流深度学习框架承担系统控制、应用服务、音视频处理与常规 AI 推理1.2 RK1828 协处理模块RKNN3 / RKLLM3 软件栈已列出对 Qwen3-8B、Qwen2.5-VL-7B 等模型的支持可面向大语言模型、视觉语言模型与多模态 AI 应用进行部署1.3 本次 Demo 的任务分工计算模块负责阶段输出形式RK1828 模块 A大模型推理生成文字回答Core-3588JD4数字人音视频合成实时语音、口型、画面RK1828 模块 B预留扩展ASR、多路视频分析等大模型推理与数字人音视频链路互不挤占同一处理模块RK1828 负责生成回答Core-3588JD4 负责将回答转化为可见、可听的数字人内容。 二、从问答、识图到数字人交互整套方案采用模块化设计各环节通过标准接口协同工作步骤环节说明1用户输入在 Web 页面输入文字或上传图片并提问2模型选择在 Web 页面切换 LLM / VLM3本地推理Web 服务调用本地 RKLLM3 Server4回答生成LLM 完成文字问答 / VLM 理解图片并生成回答5数字人驱动回答按句发送至 Digital Man6实时呈现生成语音、口型与数字人画面7终端输出显示设备呈现画面耳机或扬声器播放声音2.1 流式回答降低等待感与传统“云端请求—等待结果—播放固定内容”的方案不同当前 Demo 支持大模型回答的流式处理模型一边生成内容数字人一边组织播报在降低等待感的同时让交互过程更加自然️ 三、多模态交互文字 图片同时理解Web Demo 通过 OpenAI 兼容接口调用设备上的 RKLLM3 Server并支持在页面中切换已部署的 LLM 与 VLM 模型LLM 模式完成常规文字问答VLM 模式上传图片并提问图片与文本将一并发送给本地推理服务由视觉语言模型完成图片内容理解并生成回答能力输入处理输出文字问答文本LLM 本地推理数字人流式播报图片理解图片 文本VLM 多模态推理数字人解释图片内容3.1 Web 端实拍界面从界面可见左侧为实时数字人助手中间为 LLM/VLM 对话区示例中识别了交通标识、温湿度计等图片右侧为场景卡片整体为单页面多模态交互入口。️ 四、实时口型与音画同步Digital Man Demo 接收大模型生成的文本后实时完成语音合成、数字人口型生成以及音视频同步输出。当前数字人输出规格包括项目规格数字人画面720 × 940RGB888视频帧率20 FPS原始语音16 kHz、16 bit、单声道显示输出HDMI 或 DSI双连接时优先 HDMI文本通信Unix Domain Socket 流式传输数字人画面通过Rockit VO硬件图层输出充分利用平台多媒体能力语音数据则通过Rockit AO输出并可根据实际声卡能力进行采样率适配。⚙️ 五、端侧部署的核心价值在采用本地模型且不调用外部服务时用户问题和模型推理数据可以保留在设备侧。端侧异构部署还带来以下价值价值点说明 减少网络等待模型部署在本地减少云端网络往返和网络波动带来的额外等待 数据更可控可根据项目要求在本地完成问题处理和模型推理无信息泄露风险 部署更灵活适合展厅、前台、园区、门店及其他边缘场景️ 交互形式丰富同一 Web 入口支持文字问答、模型切换和图片识别无需额外切换⚡ 任务可并行大模型与数字人音视频任务可由不同计算模块独立承担 扩展空间充足当前仍有一个 RK1828 模块未被本 Demo 占用可继续部署其他 AI 能力 六、Web 端灵活配置与多模态交互Web Demo 不仅提供直观的聊天界面还支持模型管理LLM / VLM 模型切换图片上传流式回答数字人联动控制通过环境变量配置SYSTEM_PROMPT还可以快速定义数字人的身份、品牌背景和服务风格。例如可将数字人设定为技术顾问你是官方数字人代表公司为用户提供专业、热情、通俗易懂的技术咨询与服务。请将复杂技术转化为用户可感知的价值并尽量使用适合语音播报的自然表达。同一套技术底座可以根据场景快速切换为角色场景产品讲解员展厅、发布会企业前台办公楼、服务大厅展厅导览员博物馆、科技馆智能客服零售、政务行业知识助手医疗、教育、工业 七、可落地的应用场景场景关键能力典型用途️ 展厅导览持续介绍企业、产品和解决方案并根据访客提问实时生成个性化回答传统展板升级为可交流的智能讲解员 产品咨询与技术支持7×24 在线问答、图片识别、方案推荐官网、线下门店、售后入口 政务、医疗与公共服务政策解读、就诊引导、信息查询政务大厅、医院导诊台 智能座舱与机器人语音/视觉多模态交互、车机联动车载助手、服务机器人 教育与知识传播课程讲解、知识点问答、作业辅导在线教育、培训教室 八、当前完成与后续规划8.1 已完成的链路序号能力✅ 1Web 页面与 RKLLM3 本地大模型联调✅ 2Web 页面支持在已部署的 LLM 与 VLM 模型之间切换✅ 3支持上传图片并调用 VLM 进行图片识别与内容分析✅ 4大模型回答的流式输出✅ 5Web Demo 与 Digital Man 服务联动✅ 6数字人实时语音、口型和画面生成✅ 7基于新会话标识的当前播报打断与内容切换✅ 8HDMI 显示和声卡输出实机验证代码同时支持 DSI 横屏显示✅ 9Web Demo 支持通过环境变量配置 System Prompt8.2 后续计划扩展方向目标 语音输入接入麦克风和 ASR实现直接语音提问 知识库接入企业知识库增强专业领域回答能力 更多并行模型利用空闲 RK1828 模块部署独立 ASR 等模型⚖️ 任务调度将不同模型分配到不同协处理模块实现更多 AI 任务并行 业务对接对接业务系统、智能家居或机器人控制接口 多角色增加多角色、多音色及更多数字人形象8.3 最终交互链路用户说话 → ASR 语音识别 → 大模型理解与生成 → 数字人实时播报 → 业务系统或设备执行✅ 总结Web 大模型与 Digital Man Demo 的成功联动验证了 AIBOX PRO 承载端侧大模型推理、数字人音视频生成以及异构模块协同的可行性为进一步构建完整语音交互系统提供了基础。依托 Core-3588JD4 与 RK1828 的异构分工AIBOX PRO 还可以继续向语音识别、多路视频分析、智能设备控制等方向扩展并通过更换模块来支持更多样化的模型需求。未来端侧大模型、数字人、多模态感知与行业应用的结合将让边缘 AI 设备承载更多个性化 AI 能力也让每一次人机交互更加简单、智能和有温度。