爱诗科技PixVerse R2破解Scaling难题:实时、交互、持续进化
2026-09-25 · 第二证券
2026年9月23日,爱诗科技(AIsphere)正式发布全球首个具备Scaling能力的通用实时世界模型PixVerse R2,并开放游戏、互动影视、数字人等体验。基于Omni Causal AR(全模态因果自回归)与Real-Time Acceleration(实时加速)两层架构,通用实时世界模型第一次像大语言模型一样,拥有了一条清晰、确定、可以被验证的
2026年9月23日,爱诗科技(AIsphere)正式发布全球首个具备Scaling能力的通用实时世界模型PixVerse R2,并开放游戏、互动影视、数字人等体验。基于Omni Causal AR(全模态因果自回归)与Real-Time Acceleration(实时加速)两层架构,通用实时世界模型第一次像大语言模型一样,拥有了一条清晰、确定、可以被验证的持续扩展路径。
(图:PixVerse R2 上线后迅速登上X(twitter) 美区热搜)
通用实时世界模型首次建立Scaling路径
大语言模型已验证,模型、数据和计算规模的扩大可以持续转化为能力提升。但视频是连续高维信号,实时世界模型还要同时处理空间、时间、动作、多模态输入和长期状态,并在严格延迟下及时回应用户。能力越强,计算压力越大;要保持实时,又容易牺牲质量和通用性。
爱诗科技认为,实时世界模型不应长期在能力和速度之间取舍。R2将Scaling扩展到模型、数据、任务、控制信号和时间尺度五个维度,使新增能力进入同一套世界建模路径,并转化为生成质量、长程一致性和多模态控制能力的提升。其目标并非单纯扩大参数,而是建立一套能够持续进化的实时世界模型系统。
在R2生成的世界中,用户可以通过文字、图像、语音和动作持续介入。用户既可用WASD控制角色移动、跳跃和切换视角,也可通过Prompt更换角色、添加物体或改变环境,模型会依据当前状态继续生成,并维持角色、物体和空间关系。
在互动影游《零印法师》中,玩家输入不同指令,会触发不同的角色反应、剧情走向和通关方式,剧情由模型根据输入实时推演。在《畸变回声》中,数字人Eve结合语音、人设、记忆和关系状态,根据玩家提问与剧情进展实时回应,在多轮交流中保持身份一致。由此,用户的输入不再只改变眼前画面,还会更新世界状态并影响后续发展。
过去,实时模型通常需要经过多个训练与蒸馏阶段,每次迁移都可能折损画质、动作表现和指令理解能力,规模越大,训练流程也越复杂。R2将框架收敛为两个相互衔接的核心过程。
Omni Causal AR是“能力引擎”,负责持续吸收更多数据、任务、控制信号和更长的时间跨度,让模型沿时间方向推进世界,并建立历史状态、当前输入与未来变化之间的因果关系。Real-Time Acceleration是“加速引擎”,负责把已经形成的世界建模能力尽可能完整地带入实时延迟区间。教师与学生模型共享同一因果基础,使实时加速从“重新学习世界”转变为“对已有能力提速”。
围绕这两个核心过程,R2还引入动态分块、多时间尺度记忆、Error Bank、块稀疏注意力和金字塔式分阶段生成等机制,分别处理不同节奏的输入、长期与近期状态、错误纠正及计算效率问题。其中,Error Bank针对模型运行中出现的错误状态反复训练,使长期画面漂移下降约35.8%。
爱诗科技的优势来自算法、实时系统工程与亿级用户使用反馈的结合。PixVerse长期积累的真实创作与交互数据,为模型的鲁棒性和后续Scaling提供了实验室数据之外的基础;团队在大规模实时系统建设方面的经验,则支撑了R2的训练、推理和长期稳定运行。
从行业坐标看,传统视频生成擅长高质量内容,但需要等待;实时交互系统响应迅速,却常受预设内容限制;传统游戏引擎可以稳定运行复杂世界,但主要依靠人工构建。实时世界模型试图连接三者:既生成世界,也让用户在生成过程中进入、操控并改变它。
目前,PixVerse R2仍处于发展初期。在严格的实时计算与交互延迟约束下,其复杂场景细节、运动自然度、物理一致性和长时间稳定性,与前沿离线视频模型相比仍有提升空间。但R2的价值在于,它把能力扩展和实时运行纳入同一条可持续迭代的技术路径。
爱诗科技创始人、CEO王长虎表示,实时互动视频生成不是世界模型的全部,但它是世界模型最早能被大众感知、最接近产品化、也最容易产生新体验的一条路线。未来,实时世界模型将分阶段演进:从当前的创作工具,逐步发展为可随时进入、随时互动的生成式环境,最终成为下一代生成式世界模型的底座与基础设施。
( 注: 此文属于央广网登载的商业信息,文章内容不代表本网观点,仅供参考。)