共47个模型可用
顶尖的图像生成与编辑——Gemini级别
Kling O1 推理模型,电影感画质更强
GPT Image 1.5 生成高保真图像,严格遵循提示词,并保留构图、光影与细节
Gemini级别的图像生成与编辑——完整版Nano Banana 2。
新一代图像模型——近乎完美的文字渲染(>99%)、更强的照片级真实感、UI/截图级细节,以及更出色的多语言文字(JP/KR/HI/BN)。支持可选的参考图引导生成。
精准的单图编辑,保留细节。基于 GPT-Image 2.0 的原生多模态架构。
高级图像编辑与变换
Reve 2.1——专为贴合提示词和图内排版整洁而打造。单次请求最多生成四个变体,覆盖从方形到宽屏的各种画幅,整组图像的版式和文字位置保持一致。价格偏高,是目录中文字渲染最清晰的模型。
NVIDIA 旗舰级写实文生图模型,可选智能体式精修——每轮生成多张候选图像,并在轮次之间重写提示词以提升提示词遵循度。顶级的物理感知写实效果,支持结构化 JSON 提示词扩展。
高端图像模型,擅长精准的文本生成图像与多参考图编辑——产品视觉、设计素材、密集排版和商业创意。编辑模式最多支持10张参考图。
Topaz Labs Gigapixel精准图像放大——最高4x忠实放大照片,边缘锐利、细节干净。
Topaz Labs的生成式Wonder 3.5图像放大器——在放大至多4x的同时,修复并重建低质量或受损图像中的细节。
GPT-Image 2.5 Flare——随 ChatGPT Images 2.5 推出的 OpenAI 默认图像模型。快速、高质量的生成,具备自然光影、丰富纹理、复杂版式与透明背景(PNG/WebP)。
GPT-Image 2.5 Flare 图像编辑——描述对源图的修改,最多可再附加三张参考图。支持透明输出。
GPT-Image 2.5 Sunburst——OpenAI 面向高端视觉工作的精细图像模型。以更长的生成时间换取复杂细节上的更高保真度。
GPT-Image 2.5 Sunburst 图像编辑——依据指令和源图进行精确、保留细节的编辑,最多可附加三张参考图。
Meta的Muse Image模型能忠实遵循指令,视觉保真度出色,文字、图表、二维码等细节都能准确呈现。可从文本提示词生成九种宽高比的图像,统一价格每张$0.01。
Meta的Muse Image模型编辑模式——精准编辑,只改动你要求的部分,多轮之间保持一致,并可融合多张参考图像。支持1-10张参考图像,每张输出图像$0.01。
Wan 2.7图像模型,更高质量档位——文本生成图像与图像编辑一体。
Ideogram 的 V4——同类最佳的图内文字渲染、更锐利的排版、更强的提示词遵循度,以及三种渲染速度(TURBO / BALANCED / QUALITY)。原生支持多种画面比例,制作海报、标志、缩略图和广告无需微调。
将图像拆分为可编辑图层——背景、主体以及每个关键视觉元素各自成为独立的透明PNG。基于Seedream 5.0 Pro的图像理解能力,分离后结构与细节依然保留。图层数量取决于图像本身。
xAI 的 Grok Imagine Image 2.0——快速 text-to-image,可选 2K,提供低/中质量档位和从超宽到超高的十三种画面比例。每次请求最多四张图像。
xAI 的 Grok Imagine Image 2.0,统一低价——字体清晰、精准遵循提示词,提供五种画面比例。每次请求一张图像,无质量或分辨率选项。
xAI 的 Grok Imagine Image 2.0 编辑模式——最多提供三张图像,它会在保持身份和风格的前提下进行编辑、合成或风格重塑。与生成模式相同的 1K/2K 及低/中档位,每次请求最多四张结果。
Google 的虚拟试穿模型。将人物照片与服装商品图像合成为逼真的试穿效果图。
Topaz Labs的Bloom 2创意图像放大器——重塑细节,带来惊艳提升。最适合值得高端质感的AI生成图像。
Krea 2 Turbo——速度优化的 text-to-image 生成,保留 Krea 2 的完整美学表现。配合提示词扩写与加速模式,快速构思创意。
Microsoft的MAI-Image-2.5——通用文本生成图像模型,照片级真实感强,贴合提示词,并能在图像中渲染文字。单次请求最多4张图像,支持七种宽高比。
Grok Imagine 的图像版本。支持 text-to-image 以及 image-to-image 变体编辑,严格遵循提示词。Grok Imagine Video 的姊妹模型。
SeedVR2图像放大——快速、低价,最高4x。日常放大性价比极高。
Wan 2.7图像模型——文本生成图像与图像编辑一体。
Tongyi-MAI的轻量6B图像模型——写实输出、亚秒级生成,双语(英文+中文)文字渲染尤为准确。采用Apache-2.0许可。
快速、低成本的Gemini图像模型——快速构思、高吞吐生成和轻量编辑。专为概念探索、社交视觉、产品草图和规模化生产打造。
将图像中的文字翻译成另一种语言,并得到干净的本地化版本——非常适合海报、菜单、截图和产品图的本地化。
Nano Banana标准图像生成
Nano Banana图像编辑
FLUX 2 Pro 图生图编辑
FLUX 2 Flex 快速文生图
Seedream 4.0文本生成图像
Seedream 4.5文本生成图像,质量更佳
Seedream 5.0 Lite快速文本生成图像
GPT-4o 多模态图像生成
Qwen文本生成图像
Qwen 2改进的文本生成图像
Topaz AI图像放大,并增强细节
Recraft AI背景移除
Recraft AI清晰图像放大
共55个模型可用
Sora 2,质量更高、时长更长
顶尖的视频生成模型,质量与理解力卓越
高端视频生成模型,支持原生音频
ByteDance最新的视频模型。可从提示词、起始帧或最多50个图像、视频和音频参考,在一个镜头内生成最长30秒并带同步音频的视频——对白、音乐和音效一次生成。
Alibaba旗下Wan 3.0的高端档位——出片更快、运动更具电影感、视觉连贯性更强。支持文本、图像和参考模式,单次生成原生30秒片段,带音频。
经过后训练的 MiniMax H3,在整体质量、提示词理解和美学上排名第 1,领先于主流视频模型。可根据提示词、首帧,或最多 9 张参考图、3 段动态片段和 3 段音频,生成原生 480p、768p 或 1080p 的 5-15 秒短片。参考视频生成已正式发布:速度提升最高 2 倍,主体一致性大幅增强。
MiniMax H3 Max with a built-in camera rig. Your still frame stays frozen while the camera flies a path you choose — orbit around a subject, push in, crane overhead, or set up to 12 poses by hand. 5-15 second clips in native 480p, 768p or 1080p.
Kling 最新旗舰,运动表现同类最佳,画质具电影感
Alibaba最新的视频模型。单次生成原生30秒片段——无需拼接——带音频和现实级运动表现,可由提示词、起始帧,或图像、视频和音频参考生成。
支持 LoRA 的 MiniMax H3(Hailuo-03),用于 image-to-video。使用自定义 LoRA 模型让图像动起来,提供四档分辨率(480p/720p/1080p/2K)、4-15 秒时长和原生立体声。质量优于基础版 H3。
MiniMax的新一代多模态视频模型(Hailuo-03)。可从文本提示词或参考图像生成最高2K、带原生立体声音频的视频,指令遵循能力强,运动自然,画面文字清晰可读。
Google 的任意输入视频模型。可从提示词、一张图像、三张参考图或一段已有视频生成 4-10 秒带原生音频的片段,再用日常语言重塑场景。基于 Gemini 的真实世界知识,物理与运动更连贯。
Google 的 Omni 视频模型 v1.1——现已支持分辨率控制(360p/720p/1080p/4K)与视频编辑。可从文本、图像、参考图或已有视频生成或转换 3-10 秒带原生音频的片段。相比 v1 升级,分辨率完全灵活。
MiniMax H3 Max on a faster inference stack at half the price. The same post-trained model tuned for prompt adherence and aesthetics — 5-15 second clips from a prompt or a start frame, in native 480p, 768p or 1080p.
最新的 Kling,运动表现与质量同类最佳
Grok Imagine Video 1.5——image-to-video,音画同步、严格遵循提示词、画质稳定。目前在 Arena 盲测榜 image-to-video 类别排名第 1,超过 Seedance 2。
Veo 3.1的更快、更具性价比的版本
Black Forest Labs 的 FLUX 3——文生视频,音频由模型自身同步生成。1080p 下最长 20 秒,无需参考图像。
Kling 2.0,质量与运动表现显著提升
Wan 2.7——文本生成视频与图像生成视频(首帧/首尾帧/续写)。
Topaz Labs的Astra 2创意视频放大器——重塑精细细节,通常输出4K。片段最长5分钟。
Topaz Labs的Hyperion 2.5专业SDR转HDR——重新分配亮度与色彩,同时保留文字、面部和运动中的细节。
高质量视频生成
较新的Runway Gen 4.5——文本生成视频,可选参考图像,5/10s。
Seedance 2.0——文本生成视频和图像生成视频。
由 Black Forest Labs 的 FLUX 3 驱动的视频超分辨率,最高 4K,提供忠于原片的 Precise 模式与增强细节的 Creative 模式。片段最长 20 秒。
Topaz Labs的专业Starlight生成式视频放大器(Starlight Precise 2.6)——重建源片中没有的细节,最高4K。
电影感视频生成
专业口型同步
参考图 + 参考视频的动作迁移。通过角色朝向开关选择由谁的姿态驱动输出。
速度优化版 Kling 3.0——生成更快,同时保持高画质。支持 text-to-video(提示词最长 2,500 字符)、首帧 image-to-video 和多镜头分镜(一段片中最多 6 个提示镜头)。Standard 档为 720p,Pro 档为 1080p。
Runway Gen-4 Turbo video generation from text or a reference image. 5 or 10 seconds; 1080p supports 5 seconds.
最新的 Kling 1.x,质量更佳
来自Luma AI的高质量视频生成
升级版电影感短视频模型——运动更流畅、指令遵循更强、原生音频表现,以及多语言口型同步。支持 text-to-video、首帧 image-to-video 和参考图生视频(最多 9 张参考图)。
高质量视频生成,运动表现强劲
视频到视频口型同步——让已有视频中的口型与目标音频对齐。支持多语言配音。
Bria 企业级授权视频背景去除,支持绿幕溢色校正。干净地去除视频片段的背景,并校正绿幕溢色,获得专业抠像效果。
电影感短视频模型——运动表现出色、电影级光影、严格遵循提示词,并支持多镜头叙事。text-to-video 与 image-to-video 共用一个接口。
将视频放大并锐化到更高分辨率。可选1x到8x的放大倍数(默认2x)。
Pika最新的视频生成模型
从图像快速生成视频
去除视频背景,得到干净的主体抠像,可直接合成到任意场景。可选保留音频和设置背景色。
潜空间口型同步模型
快速、经济的视频模型——文本生成视频与图像生成视频(首帧、尾帧或参考图),可选同步音频。适合快速草稿和大批量社交短片。
翻译短视频——转写语音,并生成目标语言的配音与字幕。每段最长6分钟。
为音轨生成可分享的视频,可选添加艺术家与站点署名。
Seedance 2.0的更快、更便宜版本——文本生成视频与图像生成视频。
Standard 级视频生成模型
Veo 3.1 Lite——经济实惠的视频生成,支持文本生成视频、图像生成视频和参考生成视频模式
MiniMax Hailuo 2.3 Pro 高质量视频生成
MiniMax Hailuo 2.3 Standard 视频生成
MiniMax Hailuo 02 Pro 视频生成
Wan 2.6 Flash快速图像生成视频
Topaz AI视频放大
共13个模型可用
高质量多语言文本转语音
高级文本转语音模型
AI音乐生成——创作歌曲、伴奏和配乐
快速文本转语音,质量良好
文本转语音模型
高质量文本转语音
Google DeepMind's latest music generation model. Generate almost any type of music from text descriptions, with optional image inspiration.
Gemini 3.1 Flash 文本转语音。30 种预设音色、80+ 种语言、行内表现力标签([sigh]、[laughing])、最长 4K 字符的风格指令,以及多说话人支持。
将曲目拆分为人声与伴奏音轨,或最多十二条独立乐器音轨。
从任意位置续写现有音轨,并保持其风格。
在你上传的伴奏上演唱。
为你上传的人声配上伴奏。
只重新生成音轨中的某一时间段,其余部分保持不变。
共3个模型可用
最多可用同一物体的四个视角重建3D网格,补全单张照片拍不到的侧面。支持导出 GLB、FBX、OBJ、USDZ 和 STL。
将单张照片转换为带贴图的3D网格。可控拓扑与面数,PBR贴图和自动绑定骨骼为可选项。支持导出 GLB、FBX、OBJ、USDZ 和 STL。
根据文本描述生成带贴图的3D网格。拓扑和面数可控,可选PBR贴图与自动绑定骨骼。支持导出GLB、FBX、OBJ、USDZ和STL。