国产团队发布实时交互视频X2.0:一步跨入AI视频的GPT‑3时刻
昨天,中国团队Xmax AI推出了一款全新的实时交互式AI视频模型——「X2.0」。经过数天内测体验,它的表现既让人意外,又充满乐趣。
不同于Seedance、Kling、Wan等追求极致画质或电影感的路线,X2.0选择了一条完全不同的交互路径:它让视频从“只能观看”变成了“可以亲手操控”。
例如,输入提示词“双眼发射激光”,右侧的输出界面立刻就会生成对应画面,光影、人物面部和运动细节都能精准匹配。

选择一个角色,画面中的人物瞬间就能切换成早川秋,动作、表情完全同步。

指定一件衣服即可一键换装,只有服装会改变,其他元素保持不变。

在手机上用手指捏一捏小狗的头,它便活灵活现地跟随手指动起来。

而且,以上所有效果都是实时生成出来的。

解读X2.0:它究竟是什么?
目前大家熟悉的AI视频模型,无论是Seedance、可灵还是Wan,其逻辑都差不多:写一段提示词,点击生成,然后等待。等它渲染完毕,会输出一段固定的视频文件。你只能观看,无法修改。
Xmax AI截然不同。
打个比方,其他模型像“看电影”,片子早已拍好剪辑完成,你从头看到尾,剧情一个字都改不了;而X2.0像“打游戏”,画面完全根据你的操作实时生成,你往左它就往左,你伸出手它就变化。你不再是观众,而是玩家。
官方将其定位为“视频流的操作系统”。这个说法听上去野心勃勃,但在体验之后我得承认,它确实捕捉到了核心——视频不再是一个既定的结果,而是一个能被实时操控的交互媒介。

响应速度有多快?毫秒级,几乎零延迟,真的就像刷抖音一样,手指划到哪里画面就变到哪里,中间没有那种令人焦躁的转圈等待。
今年2月,Xmax AI发布了第一代模型X1,在海外社交媒体引起了不少关注,但当时的能力还停留在“技术秀”的阶段。
时隔5个月,他们带来的X2.0在多个方面都做了升级:
- 画质升级,从480p提升到960p、24fps;
- 速度提升,毫秒级响应,几乎零延迟;
- 交互升级,新增实时换人、换装等能力,也支持自定义提示词。
目前,X2.0已在platform.xmaxai.com开放体验。首次注册赠送600积分,差不多够玩10分钟的视频。同时也开放了商用API,可以直接接入自己的产品。

实际体验:五大功能逐一试玩
这次X2.0带来了三大类、五项主打能力,下面一一说明。
1)实时重渲染
简单说,就是实时替换摄像头或视频里的主体,角色、服装、视觉风格都能换。
它又细分为三个:CharX换人(人变、背景不变)、ClothX换装(只换衣服)、VibeX换风格(连背景一起换)。

比如对着摄像头随手一点,自己就变成了马斯克,动作跟得很紧,几乎没有延迟。

不仅是单人,多人换装也支持。只会替换服装,动作和背景都保持不动。

而且主体角色、服装、背景的参考图全都可以自定义。你把指定素材传上去,它就会按照参考图实时渲染出新的视频。

如果要接入API,只需填入下面这段命令,就能把它搬进你自己的产品里:
// npm install @xmaxai/sdk
import { createXmaxClient, models } from "@xmaxai/sdk";
// 选择实时模型
const model = models.realtime("x2.0");
// 用你的API key创建Xmax客户端
const client = createXmaxClient({
apiKey: "<YOUR_XMAX_API_KEY>",
});
// 请求摄像头权限,使用你偏好的视频设置
const stream = await navigator.mediaDevices.getUserMedia({
video: {
frameRate: model.fps,
width: model.width,
height: model.height,
},
});
// 选择用来显示生成视频的页面元素
const remoteElement = document.querySelector("#video-output") as HTMLElement;
// 建立Xmax实时会话,发布摄像头流,并绑定远程输出元素
const realtimeClient = await client.realtime.connect(stream, {
model,
remoteElement,
});
// 通过提示词、参考图或二者同时开始生成
await realtimeClient.set({
prompt: "视频中人物衣服替换成参考图中衣服", // 用中文提示词可以获得更稳定的输出
image: "<YOUR_REF_IMAGE_URL>",
});
2)触屏交互(MoX)
这也非常有趣。只需在屏幕上轻轻拖拽(鼠标或触屏都可以),就能让静态图里的主体瞬间“活起来”,也可以在任意视频中进行实时操控。
例如,用鼠标在屏幕上一拖,画面里的小猫就活了,能跟着手指移动。

3)次元互动(DimX)
这一项最为魔幻。
可以把虚拟角色直接召唤到现实世界里。

也能把手里的蛋糕换成一只小猪。

还可以让现实中的IP活过来,用语音命令它眨眨眼。注意,这不是AI生成,而是实拍内容。

除了这三类,X2.0还有一个Free模式。打开摄像头或上传视频,自己写提示词,例如眼睛发射激光、嘴里喷火、全身着火后变成骷髅,右侧就会立即输出一段特效视频。

这足以说明,X2.0在范式上已经取得了重大突破,能够支撑更多开放的场景和玩法。

技术难点:突破实时交互的挑战
玩起来固然有趣,但底层的技术挑战却相当大。
传统视频模型使用双向注意力,是对整段视频统一建模,所有计算完成后你才能看到结果,这就是为什么要等待。Xmax则改成了逐帧自回归生成,算一帧就给一帧,把响应时间压缩到了极致。
然而这背后存在着一个“不可能三角”:速度、成本、质量,很难同时兼顾。
堆算力可以变快,但成本会高到普通人玩不起;强行加速又容易让画质崩溃。Xmax的解法是多阶段融合蒸馏,加上FP8量化等压缩手段,最终做到单张消费级显卡就能满血运行。
更厉害的是端侧部署。他们成功将模型塞进iPhone本地运行,成为首个能在手机上本地运行实时交互的模型。当然也要实事求是:端上目前是384分辨率、16fps,比网页端的960p、24fps低不少。但能在一台手机上本地实时跑起来,应用场景一下子就打开了。
另外,成本也值得单独说一说。
海外做实时交互AI视频比较有代表性的公司是以色列的Decart,它的API是每秒0.02美元(720p),折算下来是72美元/小时。而X2.0的API海外定价是6美元/小时,不到Decart的1/12;国内更低,只要20元/小时。

用一个具体场景就能看清这笔账有多划算。按Decart的价格,一个电商用户花2分钟在线试穿,成本是2.4美元,这个价位相信很多商家都难以承受;换成X2.0,同样2分钟只需0.2美元,国内更是只要6毛钱。到了这个价位,大规模部署才算真正算得过账来。

落地场景:哪些行业能被重塑?
端侧能跑,云端也用得起,这两点结合在一起,就意味着X2.0拥有了足够宽的商业空间。
随手列举几个真实能跑通的场景:
- 电商/服装:镜前实时换装,站着不动一分钟就能试穿几十套,加速下单决策,也有助于降低退货率。

- 文旅:站在景区对着镜头,一秒换上古装或超级英雄,在古迹前直接拍出科幻大片。
- 直播社交:主播一键变身,观众发弹幕就能实时控制主播的服装和动作,互动感彻底拉满。

- 虚拟陪伴:隔着屏幕跟虚拟角色互动,摄像头对准立牌,角色就在屏幕里活了过来。
- 短剧/影视:观看短剧时若对演员不满意,可以实时将其替换,甚至把自己换上去,过一把主角瘾。
- IP潮玩:把镜头对准桌上的labubu,它就能在桌面上走动、跳舞,从摆件变成伙伴。
视频社交也很有意思:跟好友视频不想素颜出镜,可以直接把自己实时换成一只正在喝咖啡的猫。这种需求,懂的都懂。

这些并不是花哨的demo,而是能直接接入实际生产流程的技术。它们覆盖了智能硬件、消费、文旅、社交、互动视频等,横跨2B和2C市场。

结语:重新定义人与画面的关系
体验完Xmax X2.0,我想把目光放得更远一些。
一百多年前,卢米埃尔兄弟放映《火车进站》,观众看到火车迎面冲来吓得四散奔逃。从那天起到今天,视频这个媒介经历了无数轮进化:黑白到彩色,电影到电视,长视频到短视频,胶片到4K再到AI直接生成。画质越来越好,生产越来越快,节奏越来越强。
但你有没有发现,有一件事一百多年来始终没有改变——你始终是坐在屏幕另一头、只能观看的那个人。视频再精彩,也是一段拍好、剪好、直接推到你面前的结果。你和画面之间,永远隔着一层玻璃。
Xmax AI真正触动到的,正是这层玻璃。
它改变的不是画质,也不是速度,而是人与画面之间的关系。你从观众变成了玩家,从被动接收变成了随时可以修改。如果说抖音把内容的分发权交到了每个人手里,那么X2.0是想把内容的生成权也实时地交出来。视频第一次不再只是一段只能观看的结果,而是一个你能伸手进去操纵的世界。
这件事的想象空间,比“又一个视频模型”要广阔得多。往小了说,可以不出门换装、看剧能换脸;往大了说,当每一块屏幕、每一个摄像头、每一副眼镜中的画面都能实时响应你时,许多商业场景就有了被重新定义的可能。
当然,我们必须实事求是。X2.0现在并不完美,960p只达到消费级的合格线,端侧还只有384分辨率,内测版也存在一些小bug。它距离终点还很远。但当所有人都在卷画质、卷电影感、服务专业创作者的时候,Xmax选择掉头去啃“人人可玩、实时交互”的视频,我从心底里喜欢这个选择。
团队来自清华KEG和HCI实验室,智谱也出自KEG,这个出身无需多言。他们自己说,正在逼近交互视频模型的GPT-3时刻。这话说得有点大,但方向我信。
平心而论,这一轮最好玩的AI视频,也许真的不在硅谷了。
想亲自体验的,现在就可以去他们官网。玩完之后记得回来告诉我,你把自己变成了什么。