← 返回拾句全部内容

LTX 2.3 把“免费视频生成”又往前推了一大步:文本、图片、补帧、扩写视频,它全都能干

YouTube2026-06-15

摘要

LTX 2.3 不只是更强的文生视频,而是把“做视频”变成了可控的拼装工作。

“The sky is really the limit here.”

深度解读

LTX 2.3 把“免费视频生成”又往前推了一大步:文本、图片、补帧、扩写视频,它全都能干

一句话总结:LTX 2.3 不只是更强的文生视频,而是把“做视频”变成了可控的拼装工作。


内容概览

  • 主题:AI视频生成、视频扩展、声音克隆、ComfyUI工作流、RunPod
  • 适合人群:AI 创作者、短视频团队、独立开发者、AIGC 爱好者、想做视频自动化的人

核心观点

  1. LTX 2.3 的核心升级,不只是参数更大 它从 19B 变成 22B,带来的不是“看起来更强”,而是视频质量、音频表现和整体可用性都更稳了。

  2. 真正好用的地方,是它把视频生成拆成了几个可控入口 文生视频、图生视频、首尾帧/中间帧生成、视频延展,创作者不是只能“抽卡”,而是能指定起点、终点和声音。

  3. 视频延展是最危险也最有想象力的功能 它能克隆人物声音、环境和镜头风格,把一段已有视频继续往后编下去,几乎是在给“伪连续内容”开门。


深度解读

不是“又一个更强模型”,而是更像一套视频拼装机

视频一开头就很直白:LTX 2.3 来了,而且比之前更猛。
这类话你大概听过一百遍了,但这次有个细节值得拎出来——它不是只升级了“会生成视频”,而是把生成路径拆得更细了。

原版 LTX 2.0 是 19B 参数,2.3 直接升到 22B 参数
这几个数字本身不是全部,但它至少说明一件事:模型容量上去了,能容纳的细节也更多了。对视频模型来说,参数增长的意义,不只是画面更顺眼,往往还意味着:

  • 动作更连贯
  • 画面边缘更稳定
  • 声音和嘴型同步更自然
  • 场景切换时不容易“发疯”

视频作者反复强调一个点:质量提升是肉眼可见的
这不是那种“实验室里分数涨了 2%”的升级,而是你一眼能看出来“这次是真的能用了”。

更重要的是,它被包装成一个 工作流体系
也就是说,LTX 2.3 不是单独站在那儿让你祈祷出片,而是配合 ComfyUI 的节点流程,用不同入口做不同事情。对于 AI 视频来说,这个思路很关键。

因为视频和图片不一样。
图片是“出一张好看的就行”,视频是“每一帧都不能太离谱”。
所以真正能让创作者上手的工具,往往不是最炫的那个,而是最容易控制的那个。


文生视频能看,图生视频才开始像工具

作者先演示的是最基础的 text to video
左侧输入 prompt,选分辨率、时长、帧率、seed,还能决定要不要自带音频。

这里有个很实用的设计:
你可以选择 custom audio,也可以让模型自己从零生成声音。听起来像小功能,但实际用途很大。

比如他给的例子是一个女人在 Times Square 走路,背景有人流动,她说话、笑、再接一句台词,最后还是自拍风格。
结果不是“像”,而是几乎把描述里的东西都给你拼出来了。

“这就是免费模型跑在你自己电脑上的结果。”

这句话其实很有传播力。
因为大家对 AI 视频的第一印象,往往还停留在“贵、慢、不稳定、要云端大显卡”。而他展示的是另外一条路:本地跑、免费模型、几分钟出片

但真正让我觉得这套东西开始变得“像生产工具”的,是 image to video

原因很简单。
文生视频有个天然问题:你给它文字,它会自己脑补;脑补得对不对,往往靠运气。
图生视频就不一样了。你先给它一个明确起点,它就不需要从零想象角色长什么样、场景在哪里、镜头大概朝哪儿。

这就像拍短片时,导演不再只说“拍个开心的女孩”,而是直接把演员、服装、场景摆在那儿。
模型要做的事情,从“凭空造人”变成“让这个人动起来”。

他用的例子很有意思:一个坐在电脑前的二次元老鼠女孩。
加上 prompt、设置时长、点运行,出来的效果不只是动了,连音频和表情都接上了。
这类案例的价值,不在于“可爱”,而在于它说明:角色一致性开始变得可控了

这对短视频、虚拟人、角色 IP 来说,太重要了。
你不用每次都重新捏一遍角色,只要有一张基准图,就能往下做动态延展。


最好玩的不是“生成”,而是“给定起点和终点,中间自己补”

如果说图生视频还是常规操作,那这次最有意思的部分,是作者加的两个新工作流:

  • first middle last frame
  • video extender

前者是“首帧 + 尾帧”,或者“首帧 + 中间帧 + 尾帧”生成视频。
后者是直接拿一段视频继续往后扩,像是给一个镜头续命。

这两个功能看起来只是“多塞几张图”,但背后的意义很大。

先说 首尾帧生成
你给模型一个开始,一个结束,它要自己补出中间运动。这就像你告诉剪辑师:

  • 片头是角色站在森林远处
  • 片尾是角色走到近景,手里举着牌子

中间怎么走、怎么转身、怎么把牌子拿起来,模型自己补。

这意味着什么?
意味着你不需要完全靠 prompt 碰运气了。
你可以先定义“故事轨迹”,再让模型补动作。

如果再加一个中间帧,那控制力又高一层。
它不是从 A 跳到 C,而是你明确告诉它,A 走到 B,再走到 C。
这就像给一个镜头设了三个关键节点,模型要负责把这些节点连起来。

作者给的三个帧案例里,有一个特别适合拿来理解这种能力:

  • 第一帧:角色在远处的森林里
  • 中间帧:角色站到镜头前
  • 最后一帧:角色举着“this is super cool”的牌子

这不是“炫技”,而是视频制作逻辑的变化。
以前很多 AI 视频像买彩票,现在更像搭积木。
你开始能决定骨架了。

再说 video extender
这个功能更猛。它直接拿一段已有视频,继续往后生成,并且尝试克隆:

  • 人物声音
  • 环境氛围
  • 镜头风格
  • 画面连续性

作者拿了几个经典例子:Asmongold、Sopranos、The Godfather。
这些案例不是随便选的,因为它们都能测试一个问题:模型能不能骗过你的眼睛和耳朵?

结果是,它相当能打。

尤其是扩写人物发言的时候,最可怕的不是画面像,而是声音和环境也能跟上。
当你听到扩写出来的台词时,往往会先怀疑:
这到底是原片,还是模型续写的?

这就是这个功能真正危险的地方。
它不是单纯“生成新内容”,而是把旧内容接着写。
你可以拿一段公开视频,继续往下做一个“看起来非常自然”的延展版本。

从创作角度,这当然很爽。
你可以做 parody、重演、魔改、二创、连续短片。
但从内容真实性角度,它也会让“视频证据”变得更脆。


声音克隆不是附加功能,而是这套工具能不能成立的关键

很多人看 AI 视频,只盯着画面。
但这次视频里最值得注意的,其实是 audio

因为视频一旦有嘴型,声音就不再是装饰,而是可信度的一半。

LTX 2.3 的做法是:
你既可以上传自定义音频,也可以让模型自己生成。
听上去只是两个选项,但背后对应的是两种完全不同的生产方式。

  1. 自己提供音频

    • 适合你已经有台词、配音、音轨
    • 模型负责让嘴型、表情和动作去贴它
  2. 模型自动生成音频

    • 适合你只有文案或想法
    • 模型自己补台词和声音

视频里最让人印象深的,就是拿《The Princess Bride》里的经典台词配到一个 3D 角色身上。
“Hello, my name is Inigo Montoya. You killed my father, prepare to die.”

这类例子为什么好用?
因为经典台词天然自带节奏、情绪和辨识度。
一旦模型能把这种音频接到虚拟角色上,并且嘴型基本对上,整个系统的可信度就立起来了。

这也说明一个现实:
以后很多 AI 视频,不会先从画面开始卷,而是从 语音、嘴型、角色稳定性 开始卷。
因为观众对“像不像”的判断,很大一部分来自这几个点。


最后的上限,不在本地电脑,而在你愿不愿意把它接进工作流

作者后半段其实在讲部署。
本地跑、RunPod 跑、24GB VRAM、4090、ComfyUI、模板安装、节点更新、内存不足怎么办……这一长串听起来很碎,但它透露出一个很现实的趋势:

AI 视频正在从“单次体验”变成“流水线工具”。

以前你用一个模型,像抽奖。
现在你更像在搭一条小型生产线:

  • 先选模型
  • 再选输入方式
  • 再选音频
  • 再选帧
  • 再选延展方式
  • 最后决定在本地跑,还是租 GPU 跑

这个变化很关键。
因为只有当工具足够模块化,它才有可能真正进入创作流程,而不只是被拿来炫一次。

RunPod 这一段也很现实。
不是每个人都有 24GB 显存,更别说本地装一套完整节点和模型。
所以他给出的方案是:租 GPU,部署模板,跑 ComfyUI,必要时通过环境变量解决 OOM(out of memory)。

这背后其实是 AI 创作工具的一个老问题:
模型本身在进步,但真正卡住用户的,往往是部署复杂度。

而 LTX 2.3 这类工作流的价值,就在于它尽量把复杂度包起来,让你少折腾一点。
你不必理解每个节点怎么写,只要知道:

  • 选什么模型
  • 放哪张图
  • 填什么 prompt
  • 是否加音频
  • 需要延展几秒

对内容创作者来说,这已经足够了。


真正值得警惕的,不只是“能生成假视频”

这类工具最容易被理解成“做假视频的神器”。
这当然没错,但说太浅了。

更深一层看,它改变的是视频的成本结构。
以前扩一段视频,要拍、要剪、要配音、要补素材。
现在只要有起点,有声音,有一张图,甚至有一个旧视频片段,就能开始往下编。

这会带来两个结果:

  • 对创作者来说,试错成本下降,内容爆发力更强
  • 对观众来说,判断内容真实性的门槛更高了

所以你会看到一种很有意思的分化:

有些人把它拿来做搞笑二创、角色续写、虚拟短片。
另一些人则会把它用于更灰色的内容包装。
技术本身并不决定用途,但它确实决定了“什么变得容易”。

LTX 2.3 最吸引人的地方,不只是它“免费”,也不是它“强”。
而是它把 文本、图像、音频、视频延展 这几件事,放到了同一个可操作框架里。

这意味着 AI 视频不再只是“生成一个结果”,
而是在允许你一步一步控制“这个结果是怎么长出来的”。

这才是它真正值钱的地方。


值得记住的话

“The sky is really the limit here.”

“This is a free model running on your computer right now.”

“Try to guess where the real video ends and where the fake video begins.”

“It works really, really well.”


标签

AI 工具 技术 案例 趋势

更多值得记住的话

“This is a free model running on your computer right now.”
“Try to guess where the real video ends and where the fake video begins.”
“It works really, really well.”