这东西到底是什么
先把最容易搞混的一件事说清楚:OpenMontage 不是一个能生成视频的模型,也不是一个网站。
它是一个你 clone 到本地的仓库。仓库里没有 AI 大脑——它假设你已经有一个 AI 编程助手(Claude Code、Cursor、Copilot、Windsurf、Codex 都行),而这个助手就是导演。仓库提供的是这位导演需要的三样东西:
- 一套片场流程(
pipeline_defs/里的 12 个 YAML)——一条片子分几个阶段、每个阶段产出什么、什么时候必须停下来等你点头; - 一套工作手册(
skills/里的几百个 Markdown)——每个阶段该怎么做、什么算做得好; - 一双手(
tools/里的 98 个 Python 工具)——生成图、找素材、配音、剪辑、渲染。
作者自己的说法是「agent-first 架构:没有代码编排器,你的 AI 编程助手就是编排器」。
为什么这个设计值得看
Section titled “为什么这个设计值得看”市面上大部分「AI 做视频」的产品,是把一段提示词丢给一个模型,等它吐一条片子出来。中间发生了什么、为什么这么剪、花了多少钱,你都不知道。
OpenMontage 反过来:它把整个制作过程写成了可读的纯文本规范。
- 每个阶段的产出物有 JSON Schema 约束,不合格不许往下走;
- 每个阶段有一串「审查点」,AI 自己要逐条自查——比如「必须至少执行 8 次联网搜索」「不许连续 3 个以上镜头是同一类型」「必须有运动的画面不许拿静态图顶替」;
- 每一次选服务商都要在 7 个维度上打分,并写进决策日志,附上「考虑过哪些替代方案」;
- 关键节点会停下来问你,不点头不往下走。
流水线地图 这个页面把这些审查点全部摊开了——12 条流水线、88 个阶段、五百多条审查规则,平时它们只存在于仓库的 YAML 里。
它真的能做出「有运动的视频」
Section titled “它真的能做出「有运动的视频」”这是作者在 README 里专门强调的一点,也是它和大量同类项目的区别。
很多工具所谓的「AI 视频」,其实是生成几张图,加个缓慢推拉,配上音乐。OpenMontage 也能这么做(动画短片 那条线就是靠这个把成本压到 30 秒约 ¥1),但它还有另一条路:从免费素材库和公开档案里建一个素材语料库,检索出真实的运动镜头,剪成时间线。
这条线叫「纪录片式蒙太奇」,成本是 0。它在流水线的审查点里甚至专门写了一条:
必须有运动的节拍要用真视频片段,不许拿静态图顶替
以及一条更狠的:
承诺了运动感就不许悄悄降级
作者公布的四条片子和它们的花费
Section titled “作者公布的四条片子和它们的花费”| 作品 | 时长 | 花费 | 做法 |
|---|---|---|---|
| 《亚历山大图书馆》 | 70 秒 | $0.02 | 五个纯手工场景 + OpenAI 旁白 + Pixabay 免费弦乐 |
| 《糖果国的午后》 | 30 秒 | $0.15 | 12 张 FLUX 图 + 交叉溶解 + 镜头运动 + 粒子 |
| 《VOID 神经接口》 | 45 秒 | $0.69 | 只用一把 OpenAI key 跑完全流程 |
| 《最后一根香蕉》 | 60 秒 | $1.33 | 6 段可灵生成的真视频 + 谷歌 TTS + 逐词字幕 |
想知道你自己那条要多少钱,用成本估算器拖一遍。
三层知识架构
Section titled “三层知识架构”这是它组织内容的方式,理解了这个,读仓库会轻松很多:
| 层 | 位置 | 回答的问题 |
|---|---|---|
| 第一层 | tools/ + pipeline_defs/ |
有什么——可执行的能力和编排流程 |
| 第二层 | skills/ |
怎么用——OpenMontage 的约定和质量标准 |
| 第三层 | .agents/skills/ |
原理是什么——外部技术的知识包 |
每个工具都声明自己依赖哪些第三层知识。流水线的审查点里甚至有一条是管这个的:
写提示词之前,每个生成工具的深层技能文档都要读过
也就是说,它连「AI 自己有没有先读文档」都要查。
原项目 calesthio/OpenMontage 采用 AGPL-3.0 授权,作者 calesthio。本站是它的中文导览与可视化,内容取自仓库的 pipeline_defs/、tools/、docs/PROVIDERS.md 和 PROMPT_GALLERY.md,同样以 AGPL-3.0 开源。
下一篇:装起来,跑通第一条