跳转到内容

这东西到底是什么

先把最容易搞混的一件事说清楚:OpenMontage 不是一个能生成视频的模型,也不是一个网站。

它是一个你 clone 到本地的仓库。仓库里没有 AI 大脑——它假设你已经有一个 AI 编程助手(Claude Code、Cursor、Copilot、Windsurf、Codex 都行),而这个助手就是导演。仓库提供的是这位导演需要的三样东西:

  1. 一套片场流程pipeline_defs/ 里的 12 个 YAML)——一条片子分几个阶段、每个阶段产出什么、什么时候必须停下来等你点头;
  2. 一套工作手册skills/ 里的几百个 Markdown)——每个阶段该怎么做、什么算做得好;
  3. 一双手tools/ 里的 98 个 Python 工具)——生成图、找素材、配音、剪辑、渲染。

作者自己的说法是「agent-first 架构:没有代码编排器,你的 AI 编程助手就是编排器」。

市面上大部分「AI 做视频」的产品,是把一段提示词丢给一个模型,等它吐一条片子出来。中间发生了什么、为什么这么剪、花了多少钱,你都不知道。

OpenMontage 反过来:它把整个制作过程写成了可读的纯文本规范

  • 每个阶段的产出物有 JSON Schema 约束,不合格不许往下走;
  • 每个阶段有一串「审查点」,AI 自己要逐条自查——比如「必须至少执行 8 次联网搜索」「不许连续 3 个以上镜头是同一类型」「必须有运动的画面不许拿静态图顶替」;
  • 每一次选服务商都要在 7 个维度上打分,并写进决策日志,附上「考虑过哪些替代方案」;
  • 关键节点会停下来问你,不点头不往下走。

流水线地图 这个页面把这些审查点全部摊开了——12 条流水线、88 个阶段、五百多条审查规则,平时它们只存在于仓库的 YAML 里。

它真的能做出「有运动的视频」

Section titled “它真的能做出「有运动的视频」”

这是作者在 README 里专门强调的一点,也是它和大量同类项目的区别。

很多工具所谓的「AI 视频」,其实是生成几张图,加个缓慢推拉,配上音乐。OpenMontage 也能这么做(动画短片 那条线就是靠这个把成本压到 30 秒约 ¥1),但它还有另一条路:从免费素材库和公开档案里建一个素材语料库,检索出真实的运动镜头,剪成时间线

这条线叫「纪录片式蒙太奇」,成本是 0。它在流水线的审查点里甚至专门写了一条:

必须有运动的节拍要用真视频片段,不许拿静态图顶替

以及一条更狠的:

承诺了运动感就不许悄悄降级

作者公布的四条片子和它们的花费

Section titled “作者公布的四条片子和它们的花费”
作品 时长 花费 做法
《亚历山大图书馆》 70 秒 $0.02 五个纯手工场景 + OpenAI 旁白 + Pixabay 免费弦乐
《糖果国的午后》 30 秒 $0.15 12 张 FLUX 图 + 交叉溶解 + 镜头运动 + 粒子
《VOID 神经接口》 45 秒 $0.69 只用一把 OpenAI key 跑完全流程
《最后一根香蕉》 60 秒 $1.33 6 段可灵生成的真视频 + 谷歌 TTS + 逐词字幕

想知道你自己那条要多少钱,用成本估算器拖一遍。

这是它组织内容的方式,理解了这个,读仓库会轻松很多:

位置 回答的问题
第一层 tools/ + pipeline_defs/ 有什么——可执行的能力和编排流程
第二层 skills/ 怎么用——OpenMontage 的约定和质量标准
第三层 .agents/skills/ 原理是什么——外部技术的知识包

每个工具都声明自己依赖哪些第三层知识。流水线的审查点里甚至有一条是管这个的:

写提示词之前,每个生成工具的深层技能文档都要读过

也就是说,它连「AI 自己有没有先读文档」都要查。

原项目 calesthio/OpenMontage 采用 AGPL-3.0 授权,作者 calesthio。本站是它的中文导览与可视化,内容取自仓库的 pipeline_defs/tools/docs/PROVIDERS.mdPROMPT_GALLERY.md,同样以 AGPL-3.0 开源。

下一篇:装起来,跑通第一条