← 返回团队博客

产品思考 - PRODUCT THINKING

Prompt后退,Agent向前

在 Vitent,大模型是发动机,Agent 是推进项目的人,资产库、画布和虚拟片场是 Agent 工作的环境。

AI生成的短视频正在成为日常内容流的一部分。

它们未必精致,但足够直接:一个反差设定、一张角色图、几句对白,就能变成一条让人停不下来的短视频。

对创作者来说,生成一个有趣片段的门槛和成本都在下降。

但片段容易,不代表项目容易。一个爆点可以靠灵感,一部完整剧集内容则需要角色、场景和镜头承接,以及统一的设定和稳定的资产风格。

所以我们想先抛出一个判断:

AI视频生成会越来越便宜,真正昂贵的是项目上下文。

我们做Vitent,就是从这个判断开始的。

Vitent是一个AI驱动的内容持续生产引擎。创作者可以从一句创意、一份大纲或一集剧本开始,最终生成一条角色场景稳定、风格统一、镜头连贯的视频。

在这个生产引擎中,最核心的位置留给Agent。

一个Agent,应该真的知道项目发生了什么

我们最近用Vitent跑了一次完整测试:从一集AI漫剧剧本开始,让Agent从零推进到完整视频生成。这个项目叫《记忆碎片》,它只是一个内部测试样本,重点不在剧本身,而是在流程里发生了什么。

Agent先确认项目的基础设置:画幅、时长、视觉风格等。剧本上传后,Agent自动从剧本中提取出角色、场景和道具,整理进项目资产库;再基于剧本生成分镜结构,把一集内容拆成场、片段和镜头;进入制作环节后,Agent把每个视频生成需要的所有资料都提前准备好,自动关联。

整个过程,创作者只需要和Agent聊天,发出指令:“批量生产资产”、“生成分镜”、“生产视频”,Agent响应指令推进流程,界面自动联动变化。

在Vitent中向Agent发出批量生成资产的指令
在Vitent中向Agent发出“批量生成资产”的指令
在Vitent中向Agent发出拆分分镜的指令
在Vitent中向Agent发出“拆分分镜”的指令
在Vitent中向Agent发出创作视频的指令
在Vitent中向Agent发出“创作视频”的指令

整个流程跑下来,最明显的体感是“顺”。不需要来回搬运信息,也不需要每次重新解释素材关系。剧本、资产、分镜、视频生成都根据同一个项目上下文往前走,人只需要在关键节点确认方向、检查结果、提出修改。

成片质量也来自同一件事:上下文没有断。角色稳定,场景统一,镜头承接更清楚,每个视频片段的画面风格保持一致,始终遵守《记忆碎片》项目设定时选定的“CG游戏”风格。它给我们的信号很明确:Agent既能让流程更顺,也能把成片质量推上去。

视频创作从“写提示词”走向“经营项目”

今天的视频模型很多,能力也在快速进化。创作者当然需要选择模型,也需要调整生成参数,但如果产品只停留在“选择模型、输入提示词、等待结果”,AI视频创作会很快陷入一种新的手工劳动。

我们觉得这里有一个值得争论的判断:

AI视频时代,Prompt工程的红利会变薄,项目上下文的价值会变厚。

原因很简单。底层模型越强,单次生成的门槛越低。今天需要复杂提示词才能得到的镜头,明天可能只需要更少描述。今天需要反复抽卡的画面,后天可能由模型一次完成。模型进步会把很多技巧变成默认能力。

但项目上下文不会自动出现。一个项目的世界观、资产版本、镜头节奏、音色风格以及多集连续性,都需要被组织、记录、引用和执行。这个部分越复杂,Agent的价值越大。

所以,我们不把Vitent单纯理解成一个“生成工具”,而更像是一个AI视频项目的工作现场。模型是发动机,Agent负责推进项目,而资产库、画布和虚拟片场,则是Agent展开工作的环境。

Vitent把Agent放进视频项目里。

更准确地说,是把Agent放进工具深处。

在Vitent里,Agent能读取和写入项目的剧本信息,参与资产初始化、资产生成修改、分镜脚本设计和画布操作。

当创作者说“继续做下一段视频”,Agent知道下一段分镜脚本在哪里。当创作者说“这个角色保持不变”,系统知道角色定义来自哪个资产。当创作者说“把这一场拍得更压迫”,Agent能找到相关场景、角色和分镜脚本,最终生成一个“有压迫感”的视频片段。

用户面对的是一个有记忆、有结构、有生产状态的项目,AI也会逐渐靠近一个真正参与项目的人。

这可能是AI视频生成产品最重要的分界线。

其他功能,都是为了让Agent更会工作

无限画布让一集内容可以被摊开。分镜脚本、角色图、场景图、道具图和视频节点可以在同一个空间里被连接起来。创作者看到的是制作现场,Agent读取的是结构化上下文。

多维资产管理让角色、场景和道具留在项目的长期记忆里。它们可以被命名、复用和编辑,不会散落在一次次生成结果中。做连续内容时,这件事会越来越重要。

3D虚拟片场解决的是生成前的空间问题:人物站在哪里,镜头从哪里看,场景关系怎样安排。这个功能天然很精确,也天然很复杂。真正有价值的方向,是让Agent根据剧本、分镜和导演语言,自动生成一个可调的片场初稿。

比如,一个分镜里写了过肩镜头、正反打关系、两个人物的相对位置和镜头运动,Agent就应该把这些信息转成片场里可调的角色站位、摄像机位置、镜头景别和构图关系。创作者可以手动拖动,也可以继续和Agent对话调整。这样既保留了导演台的控制精度,也把大量机械摆放和反复试错提前交给系统完成。

Vitent的3D虚拟片场实现复杂的角色站位
Vitent的3D虚拟片场可实现复杂的角色站位

这些能力不需要在第一篇文章里讲得很满。它们服务的目标很明确:让Agent可以读到结构、调用资产、理解镜头,并把创作任务往前推进。

Vitent的第一次发声

Vitent还很早。Agent的下一步建议还要更聪明,任务状态还要更清晰,生成后的自动分析和自动修改能力还要继续补齐。3D虚拟片场刚上线,也会在后续版本里通过Agent和分镜、资产、视频生成进行更深的联动。

但我们已经非常确定一个方向:

AI视频不会停留在“输入一句话,生成一段视频”。真正的变化会发生在项目层。

模型会继续降低单次生成成本,真正拉开差距的是持续生产:谁能保留项目记忆,组织上下文,处理跨资产、跨镜头、跨集数的协同。

这就是Vitent想做的事:让Agent进入视频项目,把创作从单次生成推进到连续生产。

我们会先和一批真实个人创作者、AI漫剧团队、教育内容团队一起,把这条工作流打磨出来。我们也会继续公开分享产品进展、真实项目过程和AI视频创作方法。

如果你正在思考AI视频如何从单次生成走向连续生产,欢迎来和我们聊。

Vitent体验地址:https://www.vitent.cn

这是我们的第一次发声。