文字 · 图片 · 参考图 → 有声视频

用 HappyHorse 生成 会说话 的 AI 视频

HappyHorse 一次生成 1080p 电影级画面和完整音轨——对白、环境音、音效全部自动与画面同步。不需要额外配音工具,也不用手动对轨。

独立信息站 · 最后更新于 2026年8月

速览

开发方
阿里巴巴
输出规格
1080p · 最长 15 秒
音频
原生生成,完全同步
参考图
最多 9 张
唇形同步语言
6 种
生成耗时
约 30–40 秒

新版本提醒

第一时间体验下一代 HappyHorse

HappyHorse 迭代非常快——每次更新都带来更好的动态表现、更长的片段和更精准的音画同步。留下邮箱,新版本或重要功能上线时我们会立刻通知你。

不发垃圾邮件,只推送版本动态,随时可一键退订。

HappyHorse 是什么?

HappyHorse 是阿里巴巴研发的 AI 视频生成模型。它可以根据一段文字描述、一张静态图片或一组参考照片生成电影级短视频,而且与大多数视频模型不同——它在生成画面的同时生成音轨:对白、环境音、拟音效果,全部与画面精准同步。

技术上,它是一个 150 亿参数的统一 Transformer,把文本、图像、视频和音频 token 放在同一个序列里处理。正因为是单次前向同时生成,口型才能对上台词、脚步声才能踩在点上——不存在事后拼接音频的第二个模型。蒸馏后的 8 步推理让生成速度很快:一条 1080p 片段通常半分钟左右就能出片。

模型亮相后不久,就在 Artificial Analysis 视频竞技场的文生视频和图生视频两个盲测榜单上登顶,此后一直稳居第一梯队。对创作者来说,结论很简单:你描述一个场景,拿回来的就是画面和声音都已就绪、可以直接发布的成片。

下一代版本追踪

HappyHorse 2:目前已知的一切

阿里目前尚未公布 HappyHorse 2 的正式发布日期。但可以确定的是:现款模型从匿名上榜到全面开放只用了几周,阿里在视频模型上的迭代节奏非常激进——下一个大版本只是时间问题,而不是会不会的问题。

本站是独立追踪站。我们持续关注官方渠道、基准测试竞技场和合作平台,一旦有任何确认信息——规格、定价、开源权重或发布日期——都会第一时间更新到这份指南。

官方公告渠道

阿里与 Qwen 的官方渠道,新版本发布和开源权重都会最先在这里官宣。

基准测试竞技场

Artificial Analysis 视频竞技场上出现的匿名新模型,往往预示着大版本即将登场——现款 HappyHorse 当初就是这样被发现的。

合作平台上架

阿里云百炼和 fal.ai 等第三方平台的 API 列表,通常在官宣后几天内就会上线新模型。

核心能力

模型现在就能做到的事——不需要插件,也不需要后期。

文生视频

用自然语言描述场景,直接得到带音频的 1080p 成片。提示词遵循度高,运镜、动作和氛围都会按你写的来。

图生视频

让静态图片动起来。用你的照片或画作作为首帧,模型会围绕它设计运动、光影和声音。

参考图一致性

上传最多 9 张参考图,锁定角色长相、服装、产品或场景,跨多个镜头保持一致——无需微调训练。

原生音频生成

对白、环境音和音效与视频在同一次生成中产出,音轨永远和画面内容严丝合缝。

多语言唇形同步

角色可以用英语、中文、日语、韩语、德语、法语开口说话,口型精准匹配,本地化内容开箱即用。

1080p 快速出片

蒸馏后的 8 步推理让全高清片段约 30–40 秒生成完毕,迭代提示词就像迭代图片一样轻快。

在哪里使用 HappyHorse

官方和合作平台都有入口,按你的使用方式挑一个。

官方网页版

最易上手

最简单的体验方式:输入提示词、按需上传参考图、下载成片。新账号一般有免费试用额度。

Qwen 应用

日常轻量使用

HappyHorse 视频生成已内置在阿里的 Qwen 助手里,可以在对话流程中顺手生成视频。

访问 qwen.ai

阿里云百炼(Model Studio)

开发者首选

面向生产环境的官方 API,按生成视频的秒数计费,适合应用集成、批量流水线和商业项目。

访问阿里云百炼

fal.ai 等第三方 API

备选 API

第三方推理平台托管了该模型,有各自的定价和 SDK——如果你的技术栈已经在用它们,会很省事。

访问 fal.ai

各平台的开放范围和免费额度政策变化很快,接入前请以平台当前定价为准。

榜单表现

Artificial Analysis 视频竞技场的盲测投票——不同模型的成片被匿名放在一起,由真人对比打分。

#1

首秀即登顶

2026 年 4 月亮相时同时拿下文生视频和图生视频两个榜单第一,领先 Sora、Veo 和可灵。

1332

Elo · 文生视频

首秀时的文生视频竞技场评分,是当时的最高纪录。

1391

Elo · 图生视频

首秀时的图生视频评分,同样刷新了纪录。

前 2

当前位置

新模型不断上榜,排名会波动;HappyHorse 始终停留在第一梯队,与字节的 Seedance 互有胜负。

竞技场分数来自真人盲测偏好投票,会随时间变化,仅供参考。HappyHorse 真正的差异点在于一个目前没有对手同时做到的组合:多参考图一致性 + 原生同步音频。 在 Artificial Analysis 查看实时排名

大家用它做什么

一个会说话、有声音的视频模型,真正能派上用场的地方。

短视频内容

为抖音、TikTok、Reels 直接产出带声音的竖屏成片,比大多数人打开剪辑软件的速度还快。

产品与营销视频

用参考图让产品在每个镜头里保持一致,旁白和环境音也一并生成,不需要棚拍。

对白场景与故事创作

角色真的能开口念台词、口型精准,让分镜预演、故事短片和 AI 电影的说服力上一个台阶。

多语言本地化

同一个场景用六种语言各说一遍、口型原生匹配——广告或讲解视频的本地化不用重拍。

常见问题

HappyHorse 是什么?

HappyHorse 是一个 AI 视频生成模型,可以根据文字、图片或参考照片生成带完整同步音频的电影级短视频。画面和声音在同一次生成中产出,所以对白、环境音和音效永远与画面内容一致。

HappyHorse 是谁开发的?

HappyHorse 由阿里巴巴研发。它于 2026 年 4 月以匿名身份出现在 Artificial Analysis 基准测试平台上,登顶视频竞技场后才被披露为阿里巴巴的项目。目前可以通过阿里自家平台和合作方 API 使用。

怎么试用 HappyHorse?

最简单的方式是官方网页版或 Qwen 助手,输入提示词就能生成并下载。开发者可以通过阿里云百炼(Model Studio)或 fal.ai 等第三方推理平台调用 API。

HappyHorse 免费吗?

通常有免费额度:官方应用的新账号会送试用点数,也经常有限时免费活动。超出免费额度后,API 按生成视频的秒数计费,720p 比 1080p 便宜。具体价格以你使用的平台为准。

HappyHorse 开源吗?

阿里巴巴宣布该模型开源并允许商用,但可下载的模型权重至今尚未放出——官方 GitHub 和 Hugging Face 页面存在,但没有模型文件。在权重发布之前,实际可用的方式仍是托管应用和 API。

支持什么分辨率和时长?

最高输出 1080p,单条片段最长约 15 秒,另有更便宜的 720p 档位。得益于蒸馏后的 8 步推理,一条片段通常 30–40 秒左右生成完毕。

它真的能生成声音和对白吗?

能——音频是与视频原生同步生成的,不是事后配上去的。包括带唇形同步的对白(支持英语、中文、日语、韩语、德语、法语)、环境音和拟音效果。目前的一个限制是:还不能上传你自己的配音让模型去对口型。

能让同一个角色出现在多个镜头里吗?

可以。上传最多 9 张参考图即可锁定角色长相、服装、产品或场景,模型会在多次生成之间保持一致——不需要微调或训练 LoRA。

生成的视频可以商用吗?

一般来说,通过付费 API 或包含商用授权的套餐生成的内容可以商用,但各平台的授权条款不同。发布商业作品前,请先确认你所用平台的具体条款。

HappyHorse 2 什么时候发布?

官方还没有公布 HappyHorse 2 的发布时间。按目前的迭代节奏,下一个大版本被普遍认为不会太远。订阅上方的新版本提醒,官方一有消息我们会立刻邮件通知你。