镜头与主体关系难以锁定
提示词很难稳定表达机位、景别、视线和镜头运动。

把导演意图,变成可编辑的世界状态
用 Box 定义主体与空间,用导演台控制摄影机和调度,让视频模型从随机生成进入可重复的影视生产。
THE PRODUCTION GAP
当前生成方式仍主要依赖提示词、参考图和反复抽卡。画面可以惊艳,但镜头语言、主体关系与空间调度难以稳定复现。
“所有视觉内容精彩与否,本质上取决于对多种元素的排列组合。”
提示词很难稳定表达机位、景别、视线和镜头运动。
主体身份、空间位置和关键状态缺少持续约束。
有效参数、创作取舍和导演判断通常随一次生成消失。
随机结果无法支撑协作、审查、版本管理与企业交付。
THE CONTROL LAYER
Story Box 不替代视频模型。它位于模型上游,把导演意图变成结构化世界状态,再把确定的拍摄任务交给最合适的模型。
输入叙事、视觉和多模态参考
定义资产、走位、镜头与节奏
保存主体、空间关系与关键状态
按任务接入视频与图像模型
进入制作、交付与企业工作流

Box 与 3D 资产交叉协作
机位、焦段、目标锁定与轨道预演
比例、边界、碰撞和主体关系
连接不同生成模型与私有部署
BOX PROTOCOL
人物 Box 定义主体,环境 Box 定义边界。镜头、位置、透视和美术关系被一次锁定,并持续保存在生产流程中。

主体身份与资产引用
位置、旋转、比例与边界
人物、物体和环境的空间关系
姿势、朝向、可见性与物理状态
关键变化与可复用创作决策
用带空间关系的贴图立方体规定主体,不依赖笨重建模流程。
Agent 可结合文本、图片和已有资产自动生成新的 Box。
把现实尺度、全景背景和预设人物映射到同一坐标体系。
Box、传统 3D 模型与生成资产可在同一场景共同工作。
AGENT-DIRECTED PRODUCTION
空间定义 → 直觉指令 → Agent 执行。每一步都在缩小模型失控空间,同时保留人工调整和方案选择。
理解场景指令,调用 Box、3D 资产、人物与全景背景,生成三套不同空间方案。
读取场景内主体位置,规划人物移动、摄影机轨道、速度和目标锁定,同样给出三套方案。
在获得授权的前提下,将用户的选择、修改、取舍和审美判断结构化,沉淀为可复用技能与个性化知识,提高长期协作效率。
SELECTED WORK
以下内容来自封测阶段的创作与交付项目。影片版权归创作者所有,未经许可禁止下载和二次传播。
PRODUCTION-LED VALIDATION
Story Box 仍处于内部封测,但产品已经在专业教育、AI 电影节项目与真实商业交付中被持续使用和验证。

双方围绕课程、项目和商业制作深度共创。合作伙伴拥有面向字节跳动、小红书、腾讯与央视等客户的内容交付经验。
THE LONG-TERM SYSTEM
短期解决影视生产的精确控制,长期把 Box 的语义控制与长时状态能力延伸到实时生成、世界模型和端侧显示。
用可编辑世界状态控制资产、空间、人物与摄影机。
让语义、交互和上下文实时转化为连续画面,同时维持长时状态。
结合生成式显示芯片,服务 VR、互动叙事和低延迟世界模型应用。