跳到正文
LibtvsAI

画面、台词、配乐,一次生成

一句提示词进去,画面、人声、配乐一起出来。

33B 开放权重全模态模型,把视频与音频打包进同一条序列 —— 5 到 15 秒的片子出来就是 768p 带 32 kHz 立体声,切点落在你写的位置,口型对得上台词。可以在网页里直接做,也可以用与 MiniMax 逐字段一致的 API。

试试:
5–15s
单条时长,24 帧/秒
32 kHz
立体声,同一次生成
768p
六种画幅
12
单次请求可切的镜头数

由 LibtvsAI 生成

这里的每一条,都是这套服务自己跑出来的

同一套 API、同一组机器,卡片上写的就是当时发出去的提示词。声音在文件里 —— 挑一条打开听。

  • 文生视频6.6s

    三个镜头,一次生成

    [Shot 1] 航拍雪脊日出,缓慢前推。 [Shot 2] At 00:02.000, 切到冰爪扎进蓝冰的低角度特写。 [Shot 3] At 00:03.800, 切到登山者迎着太阳登上山脊。 Soundscape: 风掠过岩石、冰爪踩冰、近处的呼吸声。 Non-diegetic music: 稀疏的环境 drone,一把大提琴长音。

    要求切在 2.00 s 与 3.80 s;对这个文件做场景检测,切点在 2.00 s 与 3.79 s

    分辨率
    1376×768
    source
    LibtvsAI 生成
  • 文生视频5.2s

    一句对着镜头说的话

    竖构图人像。木质吧台后的年轻咖啡师直视镜头说话,左侧窗户透进温暖的晨光,身后的咖啡机正在出蒸汽。 <d>[English] We roast this one ourselves. Come by before nine and it is still warm.</d> Soundscape: 蒸汽棒的嘶声、杯碟碰撞、安静的室内底噪。

    静音帧占 14.8%(词与词之间的停顿),而这里没有台词的片子全是 0%;左右声道相关 0.988,人声居中

    分辨率
    768×1376
    source
    LibtvsAI 生成
  • 首尾帧5.2s

    两张图,中间由模型补出来

    一个不间断的运动:镜头从日出的雪脊升起,云层稀薄下去变成黑色天空与星场,画面最后落进被白光灌满的星舰舰桥内部。 Soundscape: 风声逐渐稀薄至真空,随后是室内底噪。 Non-diegetic music: 一个贯穿整个转场的合成器长音。

    首帧与它那张输入图差 3.5/255,末帧与它那张差 3.6/255;交叉比对是 86 和 88,两端都钉住了,中间是新画出来的

    分辨率
    1376×768
    source
    LibtvsAI 生成

能力

同一条上下文,所有模态 —— 每一条说法下面都有一个实测数字

关于生成效果的说法写起来便宜、验起来难,所以这里每一条下面都附上它是怎么测出来的。模型卡上写了、但我们自己没验过的,这一页不写。

画面与声音,一次生成

视频行与音频行被打包进同一条序列做全自注意力,没有 cross-attention,也没有 mask。同步不是事后对齐出来的——根本没有事后。通常要串 TTS、对口型、配乐、混音四道后期,每一道都是一次走偏的机会,这里一道都没有。

32 kHz 立体声,24 fps,同时产出

按时间戳切镜

在提示词里写 `At 00:02.000, 切到…`,切点就落在那里。一次生成直接出多镜头成片,不需要剪辑台拼接,而且音效跟着镜头一起切,不是铺在下面。

要求 2.00 s / 3.80 s,实测切在 2.00 s / 3.79 s

首帧、尾帧,或两端一起钉住

给一张图,片子从这里开始;只给尾帧,片子走到这里为止;两端都给,模型补中间。只给尾帧是一种正经模式,不是附带功能——你手上已经有某个画面时,就是这么用的。

被钉住的一端与输入图差 3.9/255,另一端差 53 —— 先守住,再动起来

一张图定人

一张人像参考,同一张脸就会出现在毫不相干的新场景里。五官、发型、气质保持住,而环境、服装、光线完全按新的提示词走。再加一段台词,这个人就把它说出来。

一张人像参考,两个全新场景,同一个人

运镜可以照搬

给一段视频,新画面就沿用它的镜头运动。参考条件化的是运动而不是内容——你借给它的是摄影机,不是场景。

帧间运动量:参考片 1.25,带参考 1.70,不带参考 14.68

环境声与配乐,分层生成

提示词里区分「画面里发出的声音」和「盖在画面上的音乐」,模型会把两层分开生成。出来的是真实声场,不是把单声道复制成两声道。

场景样本 L/R 相关 0.62;口播样本 0.988——人声本就该居中

三种用法

文字、关键帧、参考素材 —— 同一个请求体

没有模式开关。模式由 content 里放了什么推断出来,规则与官方托管接口完全一致,所以结构化提示词和你自己的素材可以留在同一次调用里。

文生视频

文字生成视频与声音

一句提示词、一次生成,出来就是成片:镜头按你写的时间戳切开,场景里该有的环境声和音效在里面,配乐盖在上面。没有任何一层是后期补的。

  • 三个切点的六秒短片,不开剪辑软件
  • 提案之前先把广告的画面和配乐做出来
  • 口播视频,口型是真的对上的

content: [text]

首尾帧

从你的图开始,到你的图结束,或者两端都钉住

给一张图,片子从这里开始;只给尾帧,片子走到这里为止 —— 这是一种正经模式,不是附带功能,你手上已经有某个画面时就是这么用的;两端都给,中间由模型补。

  • 一张产品照片开始动起来
  • 片子最后定格在你的 logo 或那张自拍上
  • 前后对比,中间的过渡由模型补出来

role: first_frame / last_frame

多模态参考

带上一张脸、一段运镜,或一个声音

参考只做条件,不决定画面。一张人像让同一个人出现在完全不同的场景里;一段视频借出的是运镜而不是内容;一段录音决定音色。一次请求最多九张图、三段视频、三段音频。

  • 同一个角色贯穿整组镜头
  • 把喜欢的那段运镜搬到新画面上
  • 每一条里的主讲人,听起来都是同一个人

role: reference_image / _video / _audio

怎么用

写下来,先去忙别的,回来就有片子。

  1. 1

    描述

    分镜、台词、画面里发出的声音、盖在上面的音乐,是四个分开的字段。想填几个填几个,只有分镜是必填的。

  2. 2

    去忙别的

    生成是实打实的计算,所以不会卡住页面。你可以离开,回来时片子已经在那儿了。

  3. 3

    预览并下载

    在网页里直接带声音播放,然后下载 mp4。你生成过的每一条都留在作品库里。

也可以在你自己的代码里调用

同一个生成能力,外面套一层与 platform.minimax.io 逐字段一致的 API。把现成的 MiniMax 客户端指过来就能用。

POST /v2/video_generation
curl https://api.libtvs.io/v2/video_generation \
  -H "Authorization: Bearer $LIBTVS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "MiniMax-H3",
    "duration": 6,
    "resolution": "768P",
    "ratio": "16:9",
    "content": [{ "type": "text", "text": "A sunrise ascent on an alpine ridge." }],
    "shots": [
      { "at_seconds": 0,   "description": "Aerial over a snow ridge, pushing in" },
      { "at_seconds": 2.0, "description": "Cut to crampons biting into blue ice" }
    ],
    "audio": { "soundscape": "Wind over rock, crampons on ice" }
  }'

{ "task_id": "424010985738629" }

常见问题

凡是模型卡说得比我们实际验过的更宽的地方,这里写的是我们验过的那个。

MiniMax-H3 是什么?

一个开放权重的 33B 全模态扩散 Transformer。视频行和音频行在同一条序列里互相注意,所以一次生成同时产出画面和声音,而不是视频模型出图之后再接一条音轨。

声音真的是和画面一起生成的吗?

是。32 kHz 立体声,同一次前向,中间没有 TTS、没有对口型、没有混音。两个我们会跑的检查:口播样本在有台词时静音帧占 25.3%、只有环境声时是 0%,说明嘴是被驱动的;场景样本的左右声道相关系数是 0.64,是真实声场,不是单声道复制两遍。

一条片子能多长?

5 到 15 秒,24 帧/秒。视觉 VAE 按块解码,帧数会向上取整到它能产出的下一个值 —— 你要 10 秒,拿到的是 10.13 秒,多出来的部分不额外计。

分辨率和画幅有哪些?

短边 768p,支持 21:9、16:9、4:3、1:1、3:4、9:16,以及 `adaptive`(跟随你上传图片的比例)。更高的分辨率需要 MiniMax 尚未开源的模块,直接在 2K 上生成属于分布外。

切镜的位置能控制吗?

写上时间戳,切点就落在那里 —— 一次请求最多十二个镜头,直接出成片;声音跟着画面一起切,因为它们本来就是一起生成的。实测:要求 2.00 秒和 3.80 秒,切在 2.00 秒和 3.71 秒。

可以用我自己的图片、视频和声音吗?

三种。作为关键帧 —— 首帧、尾帧,或者两端都给,中间由模型补。作为参考 —— 最多九张图、三段视频、三段音频,合计十二个文件,用来约束身份、运镜和音色,但不决定画面内容。也可以同时用上结构化提示:分镜、台词、环境声与配乐是分开的字段。

台词支持哪些语言?

模型卡上写的是十一种。我们在自己的硬件上实测过的只有英语,所以我们只为英语背书。语言标记是原样写进提示词的、不是猜出来的,其余语言可以试。

有 API 吗?

请求体与 `platform.minimax.io` 逐字段一致,现成的 MiniMax 客户端改一下 base URL 就能用。所有差异都是取值上的限制而不是结构变化,并且全部列在文档里。另外还提供一套与本地部署一致的 OpenAI 风格接口。

生成一条要等多久?

以分钟计,不是小时。具体取决于时长、画幅和当时的负载,所以工作台显示的是实际用时而不是一个承诺。生成不会卡住页面:你可以离开,回来时片子已经在作品库里。

生成的内容可以商用吗?

可以。产出归你;输入我们保留 7 天、输出 30 天,之后删除。计费按你请求的输出秒数走,没有订阅、没有起步价 —— 具体费率在定价页。

开始创作

创建账号,几分钟内就能生成第一条片子。

开始创作