1.1 概述

加入星云开发者社区,解锁 3 大专属权益 🚀

1️⃣ 系统学习|AI具身智能体精品课程免费学

2️⃣ 前沿洞察|最新案例与落地方案优先获取

3️⃣ 创作激励|参与创作活动,赢取专属奖励

业务咨询


本节介绍 XingyunAvatarAgent 端到端 SDK 的定位、能力与运行环境要求。

定位

XingyunAvatarAgent 是魔珐星云开放平台面向 Web 开发者提供的具身交互智能体 SDK。它在单一对象中把三大能力打通为一条端到端链路:

  • 感知:通过文本、语音输入等多模态方式感知环境;
  • 大脑:基于大模型文本推理并生成回复;
  • 表达:通过实时渲染的3D具身智能体将回复以语音、表情与动作实时播报出来。

开发者只需引入 SDK、创建实例并调用少量接口,即可在 Web 应用中集成一个"听得懂、答得出、说得出"的 3D 具身交互智能体。SDK 基于 JavaScript 实现,运行于 Web 环境,具备跨平台、低门槛、免发版的特点。

核心能力

  • 实时渲染与驱动:基于 WebGL 的 GPU 加速渲染,实时驱动面部表情、口型与骨骼动画,口型与语音精准同步。
  • 文本对话:以文本输入发起一轮完整对话,文本经大模型推理后由具身智能体实时播报,回复支持流式逐字返回。
  • 语音识别与麦克风:支持申请麦克风权限并进行实时语音识别,识别文本逐条返回,识别完成后自动进入对话链路。
  • 播报与 SSML:以 SSML 文本驱动具身智能体播报,支持流式分段发送,适配长文本与实时对话场景。
  • 客户端打断:支持客户端即时打断当前播报,无需等待服务端确认,打断后仍可继续交互。
  • 断线重连:连接异常断开后自动重连,恢复后无需业务手动重建会话。
  • 多状态行为控制:提供待机、聆听、交互待机等行为状态,支持状态自由切换。
  • Widget 组件展示:可在具身智能体画面上叠加字幕、图片、视频等 UI 组件。
  • 丰富的回调钩子:提供覆盖渲染层与 Agent / 语音 / 大模型 / 网络 / 配额等事件与错误的回调体系。

环境要求

  • 浏览器:Chrome 94+ / Edge 94+ / Safari 15+ / Firefox 100+(推荐 Chrome 以获得最佳性能)
  • WebGL:需要 WebGL 2.0 支持
  • 安全上下文:页面需运行在 HTTPS 或 localhost 之上(麦克风、加密媒体等能力依赖安全上下文)
  • 网络:需要稳定可用的 WebSocket 连接
  • 容器:需要一个有明确宽高的 DOM 容器元素,SDK 会在容器内创建 Canvas 进行渲染
  • 麦克风:使用语音识别功能时,需浏览器支持 navigator.mediaDevices.getUserMedia 并授予麦克风权限