文字 · 图片 · 参考图 → 有声视频
用 HappyHorse 生成 会说话 的 AI 视频
HappyHorse 一次生成 1080p 电影级画面和完整音轨——对白、环境音、音效全部自动与画面同步。不需要额外配音工具,也不用手动对轨。
独立信息站 · 最后更新于 2026年8月
速览
- 开发方
- 阿里巴巴
- 输出规格
- 1080p · 最长 15 秒
- 音频
- 原生生成,完全同步
- 参考图
- 最多 9 张
- 唇形同步语言
- 6 种
- 生成耗时
- 约 30–40 秒
新版本提醒
第一时间体验下一代 HappyHorse
HappyHorse 迭代非常快——每次更新都带来更好的动态表现、更长的片段和更精准的音画同步。留下邮箱,新版本或重要功能上线时我们会立刻通知你。
不发垃圾邮件,只推送版本动态,随时可一键退订。
HappyHorse 是什么?
HappyHorse 是阿里巴巴研发的 AI 视频生成模型。它可以根据一段文字描述、一张静态图片或一组参考照片生成电影级短视频,而且与大多数视频模型不同——它在生成画面的同时生成音轨:对白、环境音、拟音效果,全部与画面精准同步。
技术上,它是一个 150 亿参数的统一 Transformer,把文本、图像、视频和音频 token 放在同一个序列里处理。正因为是单次前向同时生成,口型才能对上台词、脚步声才能踩在点上——不存在事后拼接音频的第二个模型。蒸馏后的 8 步推理让生成速度很快:一条 1080p 片段通常半分钟左右就能出片。
模型亮相后不久,就在 Artificial Analysis 视频竞技场的文生视频和图生视频两个盲测榜单上登顶,此后一直稳居第一梯队。对创作者来说,结论很简单:你描述一个场景,拿回来的就是画面和声音都已就绪、可以直接发布的成片。
下一代版本追踪
HappyHorse 2:目前已知的一切
阿里目前尚未公布 HappyHorse 2 的正式发布日期。但可以确定的是:现款模型从匿名上榜到全面开放只用了几周,阿里在视频模型上的迭代节奏非常激进——下一个大版本只是时间问题,而不是会不会的问题。
本站是独立追踪站。我们持续关注官方渠道、基准测试竞技场和合作平台,一旦有任何确认信息——规格、定价、开源权重或发布日期——都会第一时间更新到这份指南。
官方公告渠道
阿里与 Qwen 的官方渠道,新版本发布和开源权重都会最先在这里官宣。
基准测试竞技场
Artificial Analysis 视频竞技场上出现的匿名新模型,往往预示着大版本即将登场——现款 HappyHorse 当初就是这样被发现的。
合作平台上架
阿里云百炼和 fal.ai 等第三方平台的 API 列表,通常在官宣后几天内就会上线新模型。
核心能力
模型现在就能做到的事——不需要插件,也不需要后期。
文生视频
用自然语言描述场景,直接得到带音频的 1080p 成片。提示词遵循度高,运镜、动作和氛围都会按你写的来。
图生视频
让静态图片动起来。用你的照片或画作作为首帧,模型会围绕它设计运动、光影和声音。
参考图一致性
上传最多 9 张参考图,锁定角色长相、服装、产品或场景,跨多个镜头保持一致——无需微调训练。
原生音频生成
对白、环境音和音效与视频在同一次生成中产出,音轨永远和画面内容严丝合缝。
多语言唇形同步
角色可以用英语、中文、日语、韩语、德语、法语开口说话,口型精准匹配,本地化内容开箱即用。
1080p 快速出片
蒸馏后的 8 步推理让全高清片段约 30–40 秒生成完毕,迭代提示词就像迭代图片一样轻快。
在哪里使用 HappyHorse
官方和合作平台都有入口,按你的使用方式挑一个。
官方网页版
最易上手最简单的体验方式:输入提示词、按需上传参考图、下载成片。新账号一般有免费试用额度。
各平台的开放范围和免费额度政策变化很快,接入前请以平台当前定价为准。
榜单表现
Artificial Analysis 视频竞技场的盲测投票——不同模型的成片被匿名放在一起,由真人对比打分。
#1
首秀即登顶
2026 年 4 月亮相时同时拿下文生视频和图生视频两个榜单第一,领先 Sora、Veo 和可灵。
1332
Elo · 文生视频
首秀时的文生视频竞技场评分,是当时的最高纪录。
1391
Elo · 图生视频
首秀时的图生视频评分,同样刷新了纪录。
前 2
当前位置
新模型不断上榜,排名会波动;HappyHorse 始终停留在第一梯队,与字节的 Seedance 互有胜负。
竞技场分数来自真人盲测偏好投票,会随时间变化,仅供参考。HappyHorse 真正的差异点在于一个目前没有对手同时做到的组合:多参考图一致性 + 原生同步音频。 在 Artificial Analysis 查看实时排名
大家用它做什么
一个会说话、有声音的视频模型,真正能派上用场的地方。
短视频内容
为抖音、TikTok、Reels 直接产出带声音的竖屏成片,比大多数人打开剪辑软件的速度还快。
产品与营销视频
用参考图让产品在每个镜头里保持一致,旁白和环境音也一并生成,不需要棚拍。
对白场景与故事创作
角色真的能开口念台词、口型精准,让分镜预演、故事短片和 AI 电影的说服力上一个台阶。
多语言本地化
同一个场景用六种语言各说一遍、口型原生匹配——广告或讲解视频的本地化不用重拍。
常见问题
HappyHorse 是什么?
HappyHorse 是一个 AI 视频生成模型,可以根据文字、图片或参考照片生成带完整同步音频的电影级短视频。画面和声音在同一次生成中产出,所以对白、环境音和音效永远与画面内容一致。
HappyHorse 是谁开发的?
HappyHorse 由阿里巴巴研发。它于 2026 年 4 月以匿名身份出现在 Artificial Analysis 基准测试平台上,登顶视频竞技场后才被披露为阿里巴巴的项目。目前可以通过阿里自家平台和合作方 API 使用。
怎么试用 HappyHorse?
最简单的方式是官方网页版或 Qwen 助手,输入提示词就能生成并下载。开发者可以通过阿里云百炼(Model Studio)或 fal.ai 等第三方推理平台调用 API。
HappyHorse 免费吗?
通常有免费额度:官方应用的新账号会送试用点数,也经常有限时免费活动。超出免费额度后,API 按生成视频的秒数计费,720p 比 1080p 便宜。具体价格以你使用的平台为准。
HappyHorse 开源吗?
阿里巴巴宣布该模型开源并允许商用,但可下载的模型权重至今尚未放出——官方 GitHub 和 Hugging Face 页面存在,但没有模型文件。在权重发布之前,实际可用的方式仍是托管应用和 API。
支持什么分辨率和时长?
最高输出 1080p,单条片段最长约 15 秒,另有更便宜的 720p 档位。得益于蒸馏后的 8 步推理,一条片段通常 30–40 秒左右生成完毕。
它真的能生成声音和对白吗?
能——音频是与视频原生同步生成的,不是事后配上去的。包括带唇形同步的对白(支持英语、中文、日语、韩语、德语、法语)、环境音和拟音效果。目前的一个限制是:还不能上传你自己的配音让模型去对口型。
能让同一个角色出现在多个镜头里吗?
可以。上传最多 9 张参考图即可锁定角色长相、服装、产品或场景,模型会在多次生成之间保持一致——不需要微调或训练 LoRA。
生成的视频可以商用吗?
一般来说,通过付费 API 或包含商用授权的套餐生成的内容可以商用,但各平台的授权条款不同。发布商业作品前,请先确认你所用平台的具体条款。
HappyHorse 2 什么时候发布?
官方还没有公布 HappyHorse 2 的发布时间。按目前的迭代节奏,下一个大版本被普遍认为不会太远。订阅上方的新版本提醒,官方一有消息我们会立刻邮件通知你。