能感知、懂场控、有目标的数字人智能体

稀缺的相见,如期而至。—— Cuemo 把「相见」做成 API。

点击任意角色聚焦 · ← → 切换
占位素材 · 待自研生成替换
会说话的数字人很多,能经营关系的,很少。
只会说话的
视频通话中
感知
语义
声音
视觉
记忆 · 场控
记忆
场控
输出
Cuemo
视频通话中
感知
语义
声音
视觉
记忆 · 场控
记忆
场控
输出

差别不在反应多快,在有没有一个可量化的目标可以拿来权衡。

五层,装进一个 API。

一次相见,信号自下而上穿过五层。点开任意一层,看它做了什么。

场控层 DIRECTOR CORE

首帧 100ms,我们自研的实时交互模型。

Sona-1 · 音视频实时交互数字人模型 —— 同类方案中首帧延迟最低,API 已部署上线。

<100ms
首帧延迟 · 同类方案最低
¥0.005/秒起
起步成本 · 约同类实时方案的 1/10
3
Flash · Pro · Ultra 随场景切
SONA-1 FLASH Flash · 快与省的极致

百毫秒内开口,成本低到敢让每个用户聊一整晚。为高并发、长时间的对话而生。

首帧 <100ms成本最低高并发
SONA-1 PRO Pro · 整幅画面都在呼吸

衣角、光影、背景都带呼吸感的微动,没有一处是死的。质感留给重要的人。

全画面微动质感最高¥0.008/秒
SONA-1 ULTRA Ultra · 全身都会动

挥手、起身、演示——需要真实动作的时刻,Ultra 接管画面。演出级表现力,按需调用。

真实动作¥0.056/秒演出级

手动指定档位,或开启智能路由:对话走 Flash,重要时刻升 Pro,需要动作切 Ultra。了解 Sona-1 →

创建第一个
数字人智能体

从一张角色图到第一次相见,15 分钟。