由 LibtvsAI 生成
这里的每一条,都是这套服务自己跑出来的
同一套 API、同一组机器,卡片上写的就是当时发出去的提示词。声音在文件里 —— 挑一条打开听。
- 文生视频6.6s
三个镜头,一次生成
[Shot 1] 航拍雪脊日出,缓慢前推。 [Shot 2] At 00:02.000, 切到冰爪扎进蓝冰的低角度特写。 [Shot 3] At 00:03.800, 切到登山者迎着太阳登上山脊。 Soundscape: 风掠过岩石、冰爪踩冰、近处的呼吸声。 Non-diegetic music: 稀疏的环境 drone,一把大提琴长音。
要求切在 2.00 s 与 3.80 s;对这个文件做场景检测,切点在 2.00 s 与 3.79 s
- 分辨率
- 1376×768
- source
- LibtvsAI 生成
- 文生视频5.2s
一句对着镜头说的话
竖构图人像。木质吧台后的年轻咖啡师直视镜头说话,左侧窗户透进温暖的晨光,身后的咖啡机正在出蒸汽。 <d>[English] We roast this one ourselves. Come by before nine and it is still warm.</d> Soundscape: 蒸汽棒的嘶声、杯碟碰撞、安静的室内底噪。
静音帧占 14.8%(词与词之间的停顿),而这里没有台词的片子全是 0%;左右声道相关 0.988,人声居中
- 分辨率
- 768×1376
- source
- LibtvsAI 生成
- 首尾帧5.2s
两张图,中间由模型补出来
一个不间断的运动:镜头从日出的雪脊升起,云层稀薄下去变成黑色天空与星场,画面最后落进被白光灌满的星舰舰桥内部。 Soundscape: 风声逐渐稀薄至真空,随后是室内底噪。 Non-diegetic music: 一个贯穿整个转场的合成器长音。
首帧与它那张输入图差 3.5/255,末帧与它那张差 3.6/255;交叉比对是 86 和 88,两端都钉住了,中间是新画出来的
- 分辨率
- 1376×768
- source
- LibtvsAI 生成
能力
同一条上下文,所有模态 —— 每一条说法下面都有一个实测数字
关于生成效果的说法写起来便宜、验起来难,所以这里每一条下面都附上它是怎么测出来的。模型卡上写了、但我们自己没验过的,这一页不写。
画面与声音,一次生成
视频行与音频行被打包进同一条序列做全自注意力,没有 cross-attention,也没有 mask。同步不是事后对齐出来的——根本没有事后。通常要串 TTS、对口型、配乐、混音四道后期,每一道都是一次走偏的机会,这里一道都没有。
32 kHz 立体声,24 fps,同时产出
按时间戳切镜
在提示词里写 `At 00:02.000, 切到…`,切点就落在那里。一次生成直接出多镜头成片,不需要剪辑台拼接,而且音效跟着镜头一起切,不是铺在下面。
要求 2.00 s / 3.80 s,实测切在 2.00 s / 3.79 s
首帧、尾帧,或两端一起钉住
给一张图,片子从这里开始;只给尾帧,片子走到这里为止;两端都给,模型补中间。只给尾帧是一种正经模式,不是附带功能——你手上已经有某个画面时,就是这么用的。
被钉住的一端与输入图差 3.9/255,另一端差 53 —— 先守住,再动起来
一张图定人
一张人像参考,同一张脸就会出现在毫不相干的新场景里。五官、发型、气质保持住,而环境、服装、光线完全按新的提示词走。再加一段台词,这个人就把它说出来。
一张人像参考,两个全新场景,同一个人
运镜可以照搬
给一段视频,新画面就沿用它的镜头运动。参考条件化的是运动而不是内容——你借给它的是摄影机,不是场景。
帧间运动量:参考片 1.25,带参考 1.70,不带参考 14.68
环境声与配乐,分层生成
提示词里区分「画面里发出的声音」和「盖在画面上的音乐」,模型会把两层分开生成。出来的是真实声场,不是把单声道复制成两声道。
场景样本 L/R 相关 0.62;口播样本 0.988——人声本就该居中
三种用法
文字、关键帧、参考素材 —— 同一个请求体
没有模式开关。模式由 content 里放了什么推断出来,规则与官方托管接口完全一致,所以结构化提示词和你自己的素材可以留在同一次调用里。
文字生成视频与声音
一句提示词、一次生成,出来就是成片:镜头按你写的时间戳切开,场景里该有的环境声和音效在里面,配乐盖在上面。没有任何一层是后期补的。
- 三个切点的六秒短片,不开剪辑软件
- 提案之前先把广告的画面和配乐做出来
- 口播视频,口型是真的对上的
content: [text]
从你的图开始,到你的图结束,或者两端都钉住
给一张图,片子从这里开始;只给尾帧,片子走到这里为止 —— 这是一种正经模式,不是附带功能,你手上已经有某个画面时就是这么用的;两端都给,中间由模型补。
- 一张产品照片开始动起来
- 片子最后定格在你的 logo 或那张自拍上
- 前后对比,中间的过渡由模型补出来
role: first_frame / last_frame
带上一张脸、一段运镜,或一个声音
参考只做条件,不决定画面。一张人像让同一个人出现在完全不同的场景里;一段视频借出的是运镜而不是内容;一段录音决定音色。一次请求最多九张图、三段视频、三段音频。
- 同一个角色贯穿整组镜头
- 把喜欢的那段运镜搬到新画面上
- 每一条里的主讲人,听起来都是同一个人
role: reference_image / _video / _audio
怎么用
写下来,先去忙别的,回来就有片子。
- 1
描述
分镜、台词、画面里发出的声音、盖在上面的音乐,是四个分开的字段。想填几个填几个,只有分镜是必填的。
- 2
去忙别的
生成是实打实的计算,所以不会卡住页面。你可以离开,回来时片子已经在那儿了。
- 3
预览并下载
在网页里直接带声音播放,然后下载 mp4。你生成过的每一条都留在作品库里。
也可以在你自己的代码里调用
同一个生成能力,外面套一层与 platform.minimax.io 逐字段一致的 API。把现成的 MiniMax 客户端指过来就能用。
curl https://api.libtvs.io/v2/video_generation \
-H "Authorization: Bearer $LIBTVS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "MiniMax-H3",
"duration": 6,
"resolution": "768P",
"ratio": "16:9",
"content": [{ "type": "text", "text": "A sunrise ascent on an alpine ridge." }],
"shots": [
{ "at_seconds": 0, "description": "Aerial over a snow ridge, pushing in" },
{ "at_seconds": 2.0, "description": "Cut to crampons biting into blue ice" }
],
"audio": { "soundscape": "Wind over rock, crampons on ice" }
}'
{ "task_id": "424010985738629" }常见问题
凡是模型卡说得比我们实际验过的更宽的地方,这里写的是我们验过的那个。
MiniMax-H3 是什么?
一个开放权重的 33B 全模态扩散 Transformer。视频行和音频行在同一条序列里互相注意,所以一次生成同时产出画面和声音,而不是视频模型出图之后再接一条音轨。
声音真的是和画面一起生成的吗?
是。32 kHz 立体声,同一次前向,中间没有 TTS、没有对口型、没有混音。两个我们会跑的检查:口播样本在有台词时静音帧占 25.3%、只有环境声时是 0%,说明嘴是被驱动的;场景样本的左右声道相关系数是 0.64,是真实声场,不是单声道复制两遍。
一条片子能多长?
5 到 15 秒,24 帧/秒。视觉 VAE 按块解码,帧数会向上取整到它能产出的下一个值 —— 你要 10 秒,拿到的是 10.13 秒,多出来的部分不额外计。
分辨率和画幅有哪些?
短边 768p,支持 21:9、16:9、4:3、1:1、3:4、9:16,以及 `adaptive`(跟随你上传图片的比例)。更高的分辨率需要 MiniMax 尚未开源的模块,直接在 2K 上生成属于分布外。
切镜的位置能控制吗?
写上时间戳,切点就落在那里 —— 一次请求最多十二个镜头,直接出成片;声音跟着画面一起切,因为它们本来就是一起生成的。实测:要求 2.00 秒和 3.80 秒,切在 2.00 秒和 3.71 秒。
可以用我自己的图片、视频和声音吗?
三种。作为关键帧 —— 首帧、尾帧,或者两端都给,中间由模型补。作为参考 —— 最多九张图、三段视频、三段音频,合计十二个文件,用来约束身份、运镜和音色,但不决定画面内容。也可以同时用上结构化提示:分镜、台词、环境声与配乐是分开的字段。
台词支持哪些语言?
模型卡上写的是十一种。我们在自己的硬件上实测过的只有英语,所以我们只为英语背书。语言标记是原样写进提示词的、不是猜出来的,其余语言可以试。
有 API 吗?
请求体与 `platform.minimax.io` 逐字段一致,现成的 MiniMax 客户端改一下 base URL 就能用。所有差异都是取值上的限制而不是结构变化,并且全部列在文档里。另外还提供一套与本地部署一致的 OpenAI 风格接口。
生成一条要等多久?
以分钟计,不是小时。具体取决于时长、画幅和当时的负载,所以工作台显示的是实际用时而不是一个承诺。生成不会卡住页面:你可以离开,回来时片子已经在作品库里。
生成的内容可以商用吗?
可以。产出归你;输入我们保留 7 天、输出 30 天,之后删除。计费按你请求的输出秒数走,没有订阅、没有起步价 —— 具体费率在定价页。
开始创作
创建账号,几分钟内就能生成第一条片子。