LTX 2.3 开源视频模型:无审查、最低 8G 显存,附下载与安装

最近开源 AI 视频模型又有大动作了!这次要介绍的是 LTX 2.3 ——由 Lightricks 推出的新一代开源音视频生成模型。相比上一代,它不仅进一步提升了视频画质、运动表现和提示词理解能力,还可以在本地同时生成视频+同步音频,并且官方提供了完整的开放权重,支持本地部署。 更关键的是,通过 FP8、NVFP4 等量化版本以及优化后的工作流,普通消费级显卡也有机会跑起来,部分方案甚至可以将显存门槛降低到 8GB 左右 。 对于喜欢本地 AI 的朋友来说,这意味着你不再需要完全依赖在线平台,视频生成可以直接在自己的电脑上完成,模型、素材和生成过程都掌握在自己手里。更重要的是,LTX 2.3

admin0
LTX 2.3 开源视频模型:无审查、最低 8G 显存,附下载与安装

最近开源 AI 视频模型又有大动作了!这次要介绍的是 LTX 2.3——由 Lightricks 推出的新一代开源音视频生成模型。相比上一代,它不仅进一步提升了视频画质、运动表现和提示词理解能力,还可以在本地同时生成视频+同步音频,并且官方提供了完整的开放权重,支持本地部署。

更关键的是,通过 FP8、NVFP4 等量化版本以及优化后的工作流,普通消费级显卡也有机会跑起来,部分方案甚至可以将显存门槛降低到 8GB 左右

对于喜欢本地 AI 的朋友来说,这意味着你不再需要完全依赖在线平台,视频生成可以直接在自己的电脑上完成,模型、素材和生成过程都掌握在自己手里。更重要的是,LTX 2.3 目前已经在 Hugging Face 开放了基础模型、FP8、NVFP4 以及大量社区量化和扩展模型,玩法非常丰富。

那么 LTX 2.3 到底能生成什么效果?8GB 显存真的能跑吗?普通 RTX 3060、3070、4090 分别应该使用哪个版本?又该如何在 ComfyUI 中安装?这篇文章就带大家从 模型下载 → 环境安装 → ComfyUI 配置 → 量化模型选择 → 实际生成测试,完整体验一下这个最新的开源 AI 视频模型。

一、安装 Comfy UI 最新版

目前需要最新版的 Comfy UI 客户端,才支持新版的LTX2.3越狱模型!如果你之前已经安装过,需要重新下载覆盖安装。

官方下载:【点击前往

网盘下载:【点击前往】 内含越狱模型

二、下载模型文件

1、越狱主模型

PinkCherry_FineTune_bf16_v1_8_LTX23(满血版)

PinkCherry_FineTune_Q5_K_M_v18_LTX23 (8G显存版)

点击下载

2、Loas

LTX-2.3\ltx-2.3-22b-distilled-lora-384-1.1

点击下载

3、Vae

总共3个

LTX23_video_vae_bf16

点击下载

taeltx2_3

点击下载

LTX23_audio_vae_bf16

点击下载

4、文本编码器

总共2个

gemma-3-12b-it-heretic-v2

点击下载

ltx-2.3_text_projection_bf16

点击下载

模型放到 C:\Users\你的用户名\AppData\Local\Comfy-Desktop\ComfyUI-Shared\models 对应的文件夹里

对应关系:

文件放置路径(相对 ...\ComfyUI\
ltx-2.3-22b-distilled-lora-384-1.1.safetensorsmodels\loras\LTX-2.3\ ← 注意要建一个 LTX-2.3 子文件夹
LTX23_video_vae_bf16.safetensorsmodels\vae\
taeltx2_3.safetensorsmodels\vae\
LTX23_audio_vae_bf16.safetensorsmodels\vae\
gemma-3-12b-it-heretic-v2.safetensorsmodels\text_encoders\
ltx-2.3_text_projection_bf16.safetensorsmodels\text_encoders\

注意要点:loras 模型文件是需要放在models\loras\LTX-2.3 文件夹里 (LTX-2.3 需要手动创建)

三、越狱模型工作流

点击下载

下载后直接拖入到 Comfy UI 的空白工作流中即可,第一次拖入会提示缺少节点文件,点击详细情况中的下载按钮,就可以自动下载!

如果你使用的是(8G显存版)PinkCherry_FineTune_Q5_K_M_v18_LTX23 .gguf格式的越狱模型,那么你需要在管理扩展功能中心,下载ComfyUI-GGUF 节点包,否则无法识别GGUF格式的模型,视频中有具体的演示:

然后把适合8G显存的PinkCherry_FineTune_Q5_K_M_v18_LTX23.gguf 量化模型,放入到 C:\Users\你的用户名\AppData\Local\Comfy-Desktop\ComfyUI-Shared\models\unet 文件夹中

具体模型载入操作:

  1. 在画布空白处双击,搜索 Unet Loader (GGUF)并鼠标双击把它拖出来
  2. 删掉现在这个 Checkpoint 加载器,用新节点的 MODEL 输出接到原来那根紫线上

四、视频提示词

1、图片生成国风视频

中国古风电影感短剧,保持参考图片中人物的脸部特征、发型、妆容、淡蓝色汉服、蓝色发簪、耳饰和整体视觉风格完全一致。

0-3秒:
近距离特写,女子安静地看向镜头,微微眨眼,嘴角带着非常自然温柔的笑意。几缕黑色发丝被微风轻轻吹动,蓝色流苏耳饰和发簪上的珠饰轻微摇晃,眼神温柔灵动。镜头非常缓慢地向前推进,浅景深,电影级柔和光线。

3-7秒:
女子缓缓转过脸,轻轻回眸看向镜头,动作优雅自然。她的手指轻轻整理耳边的一缕发丝,衣袖随着动作产生细微自然的布料运动。背景逐渐显现出古色古香的江南庭院,白墙黛瓦、木质窗棂、远处有竹林和淡淡的薄雾,空气中飘落几片浅色花瓣。

7-11秒:
镜头缓慢环绕人物,从侧前方移动到正面。女子微微低头,然后再次抬眼看向镜头,露出温柔而含蓄的笑容。耳环、发簪、发丝随着动作自然摆动,汉服衣襟和衣袖有轻微真实的动态。阳光穿过竹叶形成柔和的光影变化。

11-15秒:
女子靠近镜头一点,保持自然微笑,用非常轻柔、温婉的中文低声说道:
“公子,今日的风,很温柔。”

说完轻轻一笑,目光停留在镜头上。最后一片花瓣从镜头前缓缓飘过,画面停留在女子温柔的眼神上。

整体风格:
唯美中国风、古典东方美学、江南水乡、电影级摄影、真实人物质感、自然皮肤纹理、柔和高光、浅景深、细腻发丝、真实布料运动、自然微表情、优雅克制、浪漫唯美、高级感。

镜头运动平稳缓慢,人物动作自然连续,避免突然运动。
保持人物身份、脸部结构、服装、发型和饰品一致。
生成自然的中文女声对白,与人物嘴型同步。
同时生成轻柔的古筝音乐、微风声、竹叶沙沙声、远处鸟鸣和细微环境声。
声音整体安静、空灵、具有中国古风电影氛围。

2、生成AI短剧 (图生视频)

Cinematic realistic image-to-video scene, 10 seconds.

Keep the woman's face, hairstyle, clothing, body proportions and the original room completely consistent with the reference image. She is sitting indoors, speaking naturally to someone off camera.

0-3 seconds:
She continues speaking softly, looking slightly toward the right side of the frame. Her lips move naturally and accurately synchronized with the Chinese dialogue. She has a calm and natural expression.

Dialogue in natural Mandarin Chinese, female voice:
“你终于来了,我等你很久了。”

3-6 seconds:
She suddenly notices something unusual behind the camera. Her speech stops briefly. Her eyes shift slightly, her expression becomes confused and cautious. Natural breathing and subtle facial movement.

6-8 seconds:
She slowly turns her head toward the camera and looks directly into the lens. Her expression becomes slightly nervous and serious.

8-10 seconds:
She quietly whispers in Mandarin Chinese:
“但是……你身后有人。”

Her lips clearly articulate the Chinese words with accurate lip synchronization. Her voice is a natural young Chinese female voice, soft, realistic, slightly nervous, conversational, not exaggerated.

Audio:
Natural Mandarin Chinese female dialogue, clear human voice, accurate lip synchronization, subtle breathing, quiet indoor room ambience, very subtle background noise, cinematic realistic sound design. No music.

Camera:
Slow cinematic push-in toward her face, very subtle handheld movement, shallow depth of field, realistic focus, natural lighting.

Photorealistic cinematic image quality, realistic skin texture, natural eye movement, subtle facial expressions, realistic hair movement, smooth motion, consistent identity.

No subtitles, no text on screen, no extra people, no voice-over, no robotic voice, no exaggerated facial expressions, no face distortion, no lip deformation, no sudden camera movement.

相关推荐

评论区

评论功能即将上线,敬请期待...