持续听见真实用户
即使 AI 自己正在说话、机器人正在运动、周围存在噪声,系统依然能够持续听见真实用户。
算法降噪
AEC / 抗回声
本体声音抑制
VAD
ASR
远场语音
Double Talk
智能打断 Barge-in
面向AI 屏幕、机器人与 AR/VR,贯通多模态感知、智脑与多模态表达,形成从环境感知、智脑决策到身体表达执行的完整交互闭环。
星云不是几个能力模块的组合,而是把多模态感知、智脑、多模态表达与行动贯通为一套完整系统。端到端不是一次性的输入与回答,而是贯通持续感知、持续理解、持续决策、持续表达与行动、持续反馈的持续交互过程。
每一步的输出都会进入下一步,并随用户反馈与环境变化持续回到第一步——形成 Continuous Interaction Loop。
五项能力各自独立、逐段拼接,打断、延迟与不同步在环节之间不断累积。
AI 持续感知、理解、表达与行动,并根据用户和环境反馈进入下一轮交互。
1 持续感知语音 · 视觉 · 用户与环境状态
5 持续反馈用户反馈 · 环境变化
2 持续理解多模态融合 · 持续交互状态
4 持续表达与行动多模态表达 · 数字与物理行动
3 持续决策专属智脑 · Agent 决策
多模态感知的最终目标不是声音转文字,或摄像头识别一个人,而是持续理解用户当前的交互状态。
即使 AI 自己正在说话、机器人正在运动、周围存在噪声,系统依然能够持续听见真实用户。
从检测与识别,逐步覆盖到注视、行为、表情与多人关系,理解完整场景,最终形成持续的多模态交互状态。
将通用模型变成真正属于企业、品牌、岗位或个人的智能体,让智能体从「会回答」升级为「会做事」。
专属智脑×具身系统→能真正工作的智能体
这个智能体是谁、知道什么、应该做什么。
智能体如何感知、表达和行动——具身系统包含感知、表达、行动。
根据当前交互上下文,实时生成并同步驱动语音、表情与动作,让 AI 实现统一、连续、自然的具身表达。
真实交流包含语言、声音、语气、情绪、节奏、停顿、眼神、表情、头部动作、手势与身体动作。一个进入现实空间的 AI,不能只是 LLM + TTS,它需要真正拥有具身表达能力。
从输入上下文,到生成与驱动
表达不是预制的播放,而是根据上下文实时生成,并与感知持续同步。
最终形成——统一、连续、同步的具身表达
把渲染从昂贵云端搬到普通终端,让高质量实时数字人成为终端基础能力,实现成本更低、延迟更低、稳定性更高。
让高质量实时数字人从昂贵的云端能力,变成普通 AI 终端可以大规模部署的基础能力。
渲染在端侧完成,摆脱对云端算力的持续依赖
不再依赖视频流的长距离传输
就近渲染,交互链路更短
弱网环境下依然可用
网络波动不中断实时交互
并发不再受云端渲染资源限制
对终端芯片要求不高,成本可控
降低云 GPU、带宽、延迟与规模化部署成本,让高质量数字人成为 AI 终端基础能力。
在星云的产品体系中,AI 端渲与 Runtime 是关键技术与工程基础设施——它们支撑感知、智脑、表达与行动在终端上真正跑起来。
让智能体不只回答问题,还能真正完成任务。
屏幕也有行动,只是主要行动发生在数字世界;机器人则进一步把行动延伸到物理世界。
发生在数字世界——查询订单与库存、填写表单、创建工单、调用企业系统,完成业务流程。
发生在物理世界——转向用户、靠近用户、导航带路、执行 Robot Skill、操作现实设备。
同一个智能体:在手机上出现 → 进入固定屏 → 进入移动屏 → 进入机器人。智能体持续存在,身体不断升级。
智能体与身体解耦,同一个智能体可以跨不同终端运行——企业知识、身份、人设、记忆、Agent、任务与业务能力持续复用。
星云不是几个能力模块的拼接,而是围绕完整用户交互设计的整个系统——每一项差异,都对应一种真实的产品与工程选择。