模型目录

118个AI模型 一个平台

图像生成、视频创作、音频合成,最好的AI模型都在这里——同一套API,按量付费。

图像模型

共47个模型可用

Nano Banana Pro logo

Nano Banana Pro

图像旗舰

顶尖的图像生成与编辑——Gemini级别

~15 sec质量 96/100
Kling O1 logo

Kling O1

图像旗舰

Kling O1 推理模型,电影感画质更强

~90s质量 96/100
GPT-Image 1.5 logo

GPT-Image 1.5

图像旗舰

GPT Image 1.5 生成高保真图像,严格遵循提示词,并保留构图、光影与细节

~15s质量 95/100
Nano Banana 2 logo

Nano Banana 2

图像高级

Gemini级别的图像生成与编辑——完整版Nano Banana 2。

质量 95/100
GPT-Image 2.0 logo

GPT-Image 2.0

图像旗舰

新一代图像模型——近乎完美的文字渲染(>99%)、更强的照片级真实感、UI/截图级细节,以及更出色的多语言文字(JP/KR/HI/BN)。支持可选的参考图引导生成。

质量 95/100
GPT-Image 2.0 Edit logo

GPT-Image 2.0 Edit

图像旗舰

精准的单图编辑,保留细节。基于 GPT-Image 2.0 的原生多模态架构。

质量 94/100
FLUX Kontext Pro logo

FLUX Kontext Pro

图像高级

高级图像编辑与变换

~10 sec质量 92/100
Reve 2.1 logo

Reve 2.1

图像高级

Reve 2.1——专为贴合提示词和图内排版整洁而打造。单次请求最多生成四个变体,覆盖从方形到宽屏的各种画幅,整组图像的版式和文字位置保持一致。价格偏高,是目录中文字渲染最清晰的模型。

~10s质量 92/100
Cosmos 3 Super logo

Cosmos 3 Super

图像高级

NVIDIA 旗舰级写实文生图模型,可选智能体式精修——每轮生成多张候选图像,并在轮次之间重写提示词以提升提示词遵循度。顶级的物理感知写实效果,支持结构化 JSON 提示词扩展。

~12s质量 90/100
Seedream 5.0 Pro logo

Seedream 5.0 Pro

图像高级

高端图像模型,擅长精准的文本生成图像与多参考图编辑——产品视觉、设计素材、密集排版和商业创意。编辑模式最多支持10张参考图。

~15s质量 90/100

Topaz Precision Upscale

图像标准

Topaz Labs Gigapixel精准图像放大——最高4x忠实放大照片,边缘锐利、细节干净。

~30s质量 90/100

Topaz Wonder Upscale

图像标准

Topaz Labs的生成式Wonder 3.5图像放大器——在放大至多4x的同时,修复并重建低质量或受损图像中的细节。

~45s质量 90/100
GPT Image 2.5 Flare logo

GPT Image 2.5 Flare

图像高级

GPT-Image 2.5 Flare——随 ChatGPT Images 2.5 推出的 OpenAI 默认图像模型。快速、高质量的生成,具备自然光影、丰富纹理、复杂版式与透明背景(PNG/WebP)。

质量 90/100
GPT Image 2.5 Flare Edit logo

GPT Image 2.5 Flare Edit

图像高级

GPT-Image 2.5 Flare 图像编辑——描述对源图的修改,最多可再附加三张参考图。支持透明输出。

质量 90/100
GPT Image 2.5 Sunburst logo

GPT Image 2.5 Sunburst

图像高级

GPT-Image 2.5 Sunburst——OpenAI 面向高端视觉工作的精细图像模型。以更长的生成时间换取复杂细节上的更高保真度。

质量 90/100
GPT Image 2.5 Sunburst Edit logo

GPT Image 2.5 Sunburst Edit

图像高级

GPT-Image 2.5 Sunburst 图像编辑——依据指令和源图进行精确、保留细节的编辑,最多可附加三张参考图。

质量 90/100

Meta Muse Image

图像标准

Meta的Muse Image模型能忠实遵循指令,视觉保真度出色,文字、图表、二维码等细节都能准确呈现。可从文本提示词生成九种宽高比的图像,统一价格每张$0.01。

~8s质量 89/100

Meta Muse Image Edit

图像标准

Meta的Muse Image模型编辑模式——精准编辑,只改动你要求的部分,多轮之间保持一致,并可融合多张参考图像。支持1-10张参考图像,每张输出图像$0.01。

~10s质量 89/100
Wan 2.7 Image Pro logo

Wan 2.7 Image Pro

图像高级

Wan 2.7图像模型,更高质量档位——文本生成图像与图像编辑一体。

质量 88/100
Ideogram V4 logo

Ideogram V4

图像高级

Ideogram 的 V4——同类最佳的图内文字渲染、更锐利的排版、更强的提示词遵循度,以及三种渲染速度(TURBO / BALANCED / QUALITY)。原生支持多种画面比例,制作海报、标志、缩略图和广告无需微调。

~6s质量 88/100

Seedream 5.0 Pro Layer Decomposition

图像高级

将图像拆分为可编辑图层——背景、主体以及每个关键视觉元素各自成为独立的透明PNG。基于Seedream 5.0 Pro的图像理解能力,分离后结构与细节依然保留。图层数量取决于图像本身。

~25s质量 88/100

Grok Imagine Image 2.0

图像标准

xAI 的 Grok Imagine Image 2.0——快速 text-to-image,可选 2K,提供低/中质量档位和从超宽到超高的十三种画面比例。每次请求最多四张图像。

~10s质量 88/100

Grok Imagine Image 2.0 Fast

图像标准

xAI 的 Grok Imagine Image 2.0,统一低价——字体清晰、精准遵循提示词,提供五种画面比例。每次请求一张图像,无质量或分辨率选项。

~10s质量 88/100

Grok Imagine Image 2.0 Edit

图像标准

xAI 的 Grok Imagine Image 2.0 编辑模式——最多提供三张图像,它会在保持身份和风格的前提下进行编辑、合成或风格重塑。与生成模式相同的 1K/2K 及低/中档位,每次请求最多四张结果。

~15s质量 88/100

Google Virtual Try-On

图像标准

Google 的虚拟试穿模型。将人物照片与服装商品图像合成为逼真的试穿效果图。

~30s质量 88/100

Topaz Bloom Creative Upscale

图像高级

Topaz Labs的Bloom 2创意图像放大器——重塑细节,带来惊艳提升。最适合值得高端质感的AI生成图像。

~45s质量 88/100

Krea 2 Turbo

图像标准

Krea 2 Turbo——速度优化的 text-to-image 生成,保留 Krea 2 的完整美学表现。配合提示词扩写与加速模式,快速构思创意。

~10s质量 85/100
MAI-Image-2.5 logo

MAI-Image-2.5

图像标准

Microsoft的MAI-Image-2.5——通用文本生成图像模型,照片级真实感强,贴合提示词,并能在图像中渲染文字。单次请求最多4张图像,支持七种宽高比。

~8s质量 84/100
Grok Imagine — Image logo

Grok Imagine — Image

图像标准

Grok Imagine 的图像版本。支持 text-to-image 以及 image-to-image 变体编辑,严格遵循提示词。Grok Imagine Video 的姊妹模型。

~10s质量 82/100

SeedVR2 Upscale

图像经济

SeedVR2图像放大——快速、低价,最高4x。日常放大性价比极高。

~20s质量 82/100
Wan 2.7 Image logo

Wan 2.7 Image

图像标准

Wan 2.7图像模型——文本生成图像与图像编辑一体。

质量 80/100
Z-Image logo

Z-Image

图像经济

Tongyi-MAI的轻量6B图像模型——写实输出、亚秒级生成,双语(英文+中文)文字渲染尤为准确。采用Apache-2.0许可。

~2s质量 78/100
Nano Banana 2 Lite logo

Nano Banana 2 Lite

图像标准

快速、低成本的Gemini图像模型——快速构思、高吞吐生成和轻量编辑。专为概念探索、社交视觉、产品草图和规模化生产打造。

~15s质量 78/100
Image Translator logo

Image Translator

图像标准

将图像中的文字翻译成另一种语言,并得到干净的本地化版本——非常适合海报、菜单、截图和产品图的本地化。

~15s质量 78/100
Nano Banana logo

Nano Banana

图像标准

Nano Banana标准图像生成

质量 70/100
Nano Banana Edit logo

Nano Banana Edit

图像标准

Nano Banana图像编辑

质量 70/100
FLUX 2 Pro Edit logo

FLUX 2 Pro Edit

图像标准

FLUX 2 Pro 图生图编辑

质量 70/100
FLUX 2 Flex logo

FLUX 2 Flex

图像标准

FLUX 2 Flex 快速文生图

质量 70/100
Seedream 4.0 logo

Seedream 4.0

图像标准

Seedream 4.0文本生成图像

质量 70/100
Seedream 4.5 logo

Seedream 4.5

图像标准

Seedream 4.5文本生成图像,质量更佳

质量 70/100
Seedream 5.0 Lite logo

Seedream 5.0 Lite

图像标准

Seedream 5.0 Lite快速文本生成图像

质量 70/100
GPT-4o Image logo

GPT-4o Image

图像标准

GPT-4o 多模态图像生成

质量 70/100
Qwen Image logo

Qwen Image

图像标准

Qwen文本生成图像

质量 70/100
Qwen 2 Image logo

Qwen 2 Image

图像标准

Qwen 2改进的文本生成图像

质量 70/100
Topaz Upscale logo

Topaz Upscale

图像标准

Topaz AI图像放大,并增强细节

质量 70/100
Recraft Remove BG logo

Recraft Remove BG

图像标准

Recraft AI背景移除

质量 70/100
Recraft Upscale logo

Recraft Upscale

图像标准

Recraft AI清晰图像放大

质量 70/100

视频模型

共55个模型可用

Sora 2 Pro logo

Sora 2 Pro

视频旗舰

Sora 2,质量更高、时长更长

~90s质量 99/100
Sora 2 logo

Sora 2

视频旗舰

顶尖的视频生成模型,质量与理解力卓越

~60s质量 98/100
Veo 3.1 logo

Veo 3.1

视频旗舰

高端视频生成模型,支持原生音频

~60 sec质量 98/100
Seedance 2.5 logo

Seedance 2.5

视频旗舰

ByteDance最新的视频模型。可从提示词、起始帧或最多50个图像、视频和音频参考,在一个镜头内生成最长30秒并带同步音频的视频——对白、音乐和音效一次生成。

~3-6 min质量 97/100

Wan 3.0 Prime

视频旗舰

Alibaba旗下Wan 3.0的高端档位——出片更快、运动更具电影感、视觉连贯性更强。支持文本、图像和参考模式,单次生成原生30秒片段,带音频。

~2-5 min质量 97/100

MiniMax H3 Max

视频旗舰

经过后训练的 MiniMax H3,在整体质量、提示词理解和美学上排名第 1,领先于主流视频模型。可根据提示词、首帧,或最多 9 张参考图、3 段动态片段和 3 段音频,生成原生 480p、768p 或 1080p 的 5-15 秒短片。参考视频生成已正式发布:速度提升最高 2 倍,主体一致性大幅增强。

~1-2 min质量 97/100

MiniMax H3 Max Multi-Angle

视频旗舰

MiniMax H3 Max with a built-in camera rig. Your still frame stays frozen while the camera flies a path you choose — orbit around a subject, push in, crane overhead, or set up to 12 poses by hand. 5-15 second clips in native 480p, 768p or 1080p.

~1-2 min质量 97/100
Kling 3.0 logo

Kling 3.0

视频旗舰

Kling 最新旗舰,运动表现同类最佳,画质具电影感

~60s质量 96/100

Wan 3.0

视频旗舰

Alibaba最新的视频模型。单次生成原生30秒片段——无需拼接——带音频和现实级运动表现,可由提示词、起始帧,或图像、视频和音频参考生成。

~2-5 min质量 96/100

MiniMax H3 LoRA

视频旗舰

支持 LoRA 的 MiniMax H3(Hailuo-03),用于 image-to-video。使用自定义 LoRA 模型让图像动起来,提供四档分辨率(480p/720p/1080p/2K)、4-15 秒时长和原生立体声。质量优于基础版 H3。

~90-120s质量 96/100
MiniMax H3 logo

MiniMax H3

视频旗舰

MiniMax的新一代多模态视频模型(Hailuo-03)。可从文本提示词或参考图像生成最高2K、带原生立体声音频的视频,指令遵循能力强,运动自然,画面文字清晰可读。

~90s质量 95/100

Gemini Omni Flash

视频高级

Google 的任意输入视频模型。可从提示词、一张图像、三张参考图或一段已有视频生成 4-10 秒带原生音频的片段,再用日常语言重塑场景。基于 Gemini 的真实世界知识,物理与运动更连贯。

~2-4 min质量 95/100

Gemini Omni Flash v1.1

视频高级

Google 的 Omni 视频模型 v1.1——现已支持分辨率控制(360p/720p/1080p/4K)与视频编辑。可从文本、图像、参考图或已有视频生成或转换 3-10 秒带原生音频的片段。相比 v1 升级,分辨率完全灵活。

~2-4 min质量 95/100

MiniMax H3 Max Turbo

视频高级

MiniMax H3 Max on a faster inference stack at half the price. The same post-trained model tuned for prompt adherence and aesthetics — 5-15 second clips from a prompt or a start frame, in native 480p, 768p or 1080p.

~1 min质量 95/100
Kling 2.1 Master logo

Kling 2.1 Master

视频旗舰

最新的 Kling,运动表现与质量同类最佳

~60s质量 94/100
Grok Imagine Video 1.5 logo

Grok Imagine Video 1.5

视频旗舰

Grok Imagine Video 1.5——image-to-video,音画同步、严格遵循提示词、画质稳定。目前在 Arena 盲测榜 image-to-video 类别排名第 1,超过 Seedance 2。

~60s质量 94/100
Veo 3.1 Fast logo

Veo 3.1 Fast

视频高级

Veo 3.1的更快、更具性价比的版本

~30 sec质量 93/100

FLUX 3

视频高级

Black Forest Labs 的 FLUX 3——文生视频,音频由模型自身同步生成。1080p 下最长 20 秒,无需参考图像。

~2-4 min质量 93/100
Kling 2.0 Master logo

Kling 2.0 Master

视频旗舰

Kling 2.0,质量与运动表现显著提升

~60s质量 92/100
Wan 2.7 logo

Wan 2.7

视频高级

Wan 2.7——文本生成视频与图像生成视频(首帧/首尾帧/续写)。

质量 92/100

Topaz Astra Creative Upscale

视频高级

Topaz Labs的Astra 2创意视频放大器——重塑精细细节,通常输出4K。片段最长5分钟。

~3 min质量 92/100

Topaz SDR to HDR (Hyperion)

视频高级

Topaz Labs的Hyperion 2.5专业SDR转HDR——重新分配亮度与色彩,同时保留文字、面部和运动中的细节。

~4 min质量 92/100
Kling 1.5 Pro logo

Kling 1.5 Pro

视频高级

高质量视频生成

~60 sec质量 90/100
Runway Gen 4.5 logo

Runway Gen 4.5

视频高级

较新的Runway Gen 4.5——文本生成视频,可选参考图像,5/10s。

质量 90/100
Seedance 2.0 logo

Seedance 2.0

视频高级

Seedance 2.0——文本生成视频和图像生成视频。

质量 90/100

FLUX Video Upscale

视频标准

由 Black Forest Labs 的 FLUX 3 驱动的视频超分辨率,最高 4K,提供忠于原片的 Precise 模式与增强细节的 Creative 模式。片段最长 20 秒。

~2 min质量 90/100

Topaz Starlight Upscale

视频标准

Topaz Labs的专业Starlight生成式视频放大器(Starlight Precise 2.6)——重建源片中没有的细节,最高4K。

~3 min质量 90/100
Luma Ray 2 logo

Luma Ray 2

视频高级

电影感视频生成

~90 sec质量 88/100
Sync LipSync logo

Sync LipSync

视频高级

专业口型同步

~30 sec质量 88/100
Kling 3.0 Motion Control logo

Kling 3.0 Motion Control

视频高级

参考图 + 参考视频的动作迁移。通过角色朝向开关选择由谁的姿态驱动输出。

~90 sec质量 88/100
Kling 3.0 Turbo logo

Kling 3.0 Turbo

视频高级

速度优化版 Kling 3.0——生成更快,同时保持高画质。支持 text-to-video(提示词最长 2,500 字符)、首帧 image-to-video 和多镜头分镜(一段片中最多 6 个提示镜头)。Standard 档为 720p,Pro 档为 1080p。

~60s质量 88/100
Runway Gen-4 Turbo logo

Runway Gen-4 Turbo

视频高级

Runway Gen-4 Turbo video generation from text or a reference image. 5 or 10 seconds; 1080p supports 5 seconds.

质量 88/100
Kling 1.6 Pro logo

Kling 1.6 Pro

视频高级

最新的 Kling 1.x,质量更佳

~50s质量 87/100
Luma Dream Machine logo

Luma Dream Machine

视频高级

来自Luma AI的高质量视频生成

~40s质量 86/100
Happy Horse 1.1 logo

Happy Horse 1.1

视频高级

升级版电影感短视频模型——运动更流畅、指令遵循更强、原生音频表现,以及多语言口型同步。支持 text-to-video、首帧 image-to-video 和参考图生视频(最多 9 张参考图)。

~90s质量 86/100

Vidu 2

视频高级

高质量视频生成,运动表现强劲

~50s质量 85/100
Volcengine Lip Sync logo

Volcengine Lip Sync

视频标准

视频到视频口型同步——让已有视频中的口型与目标音频对齐。支持多语言配音。

~60s质量 85/100

Bria Video BG Removal (Green-Screen Despill)

视频标准

Bria 企业级授权视频背景去除,支持绿幕溢色校正。干净地去除视频片段的背景,并校正绿幕溢色,获得专业抠像效果。

~30-60s per clip质量 85/100
Happy Horse logo

Happy Horse

视频高级

电影感短视频模型——运动表现出色、电影级光影、严格遵循提示词,并支持多镜头叙事。text-to-video 与 image-to-video 共用一个接口。

~90s质量 84/100
Video Upscaler logo

Video Upscaler

视频标准

将视频放大并锐化到更高分辨率。可选1x到8x的放大倍数(默认2x)。

~1 min质量 84/100
Pika 2 logo

Pika 2

视频高级

Pika最新的视频生成模型

~30s质量 83/100
MiniMax Video 01 logo

MiniMax Video 01

视频标准

从图像快速生成视频

~45 sec质量 82/100
Video Background Removal logo

Video Background Removal

视频标准

去除视频背景,得到干净的主体抠像,可直接合成到任意场景。可选保留音频和设置背景色。

~30s质量 82/100
LatentSync logo

LatentSync

视频标准

潜空间口型同步模型

~45s质量 80/100
Seedance 2.0 Mini logo

Seedance 2.0 Mini

视频标准

快速、经济的视频模型——文本生成视频与图像生成视频(首帧、尾帧或参考图),可选同步音频。适合快速草稿和大批量社交短片。

~30s质量 80/100
Video Translator logo

Video Translator

视频标准

翻译短视频——转写语音,并生成目标语言的配音与字幕。每段最长6分钟。

~1-2 min质量 80/100

Music Video

视频标准

为音轨生成可分享的视频,可选添加艺术家与站点署名。

~1-2 min质量 80/100
Seedance 2.0 Fast logo

Seedance 2.0 Fast

视频标准

Seedance 2.0的更快、更便宜版本——文本生成视频与图像生成视频。

质量 78/100
Kling 1.0 Standard logo

Kling 1.0 Standard

视频标准

Standard 级视频生成模型

~30s质量 75/100
Veo 3.1 Lite logo

Veo 3.1 Lite

视频标准

Veo 3.1 Lite——经济实惠的视频生成,支持文本生成视频、图像生成视频和参考生成视频模式

质量 70/100

Hailuo 2.3 Pro

视频标准

MiniMax Hailuo 2.3 Pro 高质量视频生成

质量 70/100

Hailuo 2.3 Standard

视频标准

MiniMax Hailuo 2.3 Standard 视频生成

质量 70/100
Hailuo 02 Pro logo

Hailuo 02 Pro

视频标准

MiniMax Hailuo 02 Pro 视频生成

质量 70/100
Wan 2.6 Flash logo

Wan 2.6 Flash

视频标准

Wan 2.6 Flash快速图像生成视频

质量 70/100
Topaz Video Upscale logo

Topaz Video Upscale

视频标准

Topaz AI视频放大

质量 70/100

音频模型

共13个模型可用

3D模型

共3个模型可用