文本之外:API 如何接入图像生成能力

文本之外:API 如何接入图像生成能力

做开发经常会碰到一类配套需求:文本生成完之后需要配图、批量制作营销物料、产品原型阶段快速出视觉参考。

但现实情况是,文本大模型和图像生成服务往往分属不同服务商。分开对接,就要维护多套密钥、分开对账、查阅多份接口文档,整体开发流程会变得繁琐。

为此 OpenStarry 上线了图像生成服务,接入 Image‑2 模型,定价 0.15 元 / 张。平台内文本、生图共用同一套 API Key 和账户余额,无需单独申请开通。

Image‑2 和其他生图模型有什么不同?

市面上绝大多数生图模型基于扩散模型,本质是“猜像素”——把文字当纹理去猜测,所以经常出现乱码或错字。扩散模型的每一步去噪都是微小“估计”,用在纹理上是风格,用在文字上就是 O 变 0,或者拼出奇怪的字符。

Image‑2 换了一条技术路线。它采用自回归架构,将图像拆成离散的 token,像写文章一样逐单元生成。图像 token 与文本 token 在同一序列空间中处理,文本理解和图像生成在同一过程中完成,而不是“先理解再翻译给另一个模型去画”。

这个架构上的差异带来了几个实际变化:

文字渲染。Image-2 的文字渲染准确率约 99% 以上,而扩散模型通常在 70-85% 左右。海报标题、产品包装文字、社交媒体截图里的文案,基本能做到可读,对需要内嵌文字的设计场景会友好很多。有实测显示,它生成的菜单、信息图可以直接使用,不需要人工修正。

世界知识。Image-2 不是从零开始学的图像模型——它从 GPT-4o 这个已经“懂世界”的多模态模型发展而来。GPT-4o 在训练阶段见过海量的图文配对数据:网页截图、应用界面、产品包装、地图、图表、游戏画面。所以它不只是“见过很多类似的图”,而是理解了这些界面的结构逻辑。它知道购物网站的商品图左上角通常有折扣标签、视频平台的播放按钮在画面中央、iOS 设置界面的布局长什么样。这不是靠画得多了拼出来的,而是它真的理解这些界面应该长什么样。对需要快速出视觉参考、原型设计的场景来说,能省很多后期调整的功夫。

审美取向。它更偏向保留现实中的瑕疵和不规则感——胶片颗粒、手持拍摄的轻微失焦,而不是把画面修得像家居广告。如果你需要的是“自然拍出来的感觉”,这个方向会更合适。

风格覆盖写实、插画、二次元等常见类型,支持输出带透明通道的 PNG 图片。

补充一点:国内也有走类似路线的模型。百度文心5.0采用原生全模态统一建模,同样使用统一的自回归架构,从底层将文本、图像等模态联合训练,和Image-2的逻辑一致。这说明“自回归+统一建模”正在成为一个被验证的方向。

当然,模型也有明显的局限。面对强三维逻辑内容,比如产品结构图、折纸步骤示意图,出错概率较高;亚洲人物面部的一致性仍有待优化。AI 生成内容可能存在事实偏差,仅适合作为方案参考图,不可直接用于上线成品,正式使用一定要人工复核。

怎么开始用?

登录 OpenStarry 控制台,接口文档也已同步更新。

计费直接扣取账户余额:0.15 元 / 张。新注册账号拥有免费额度,可以先完成测试再投入业务使用。

主要入参参考:

model:Image-2 —— 标准模型名,以控制台或最新文档中的确切名称为准

prompt:咖啡店宣传海报,写有文字「今日特惠:美式咖啡 15 元」 —— 直接使用自然中文即可

n:1 —— 生成数量,范围通常为 1-4(或 1-10),这里只生成 1 张

size:1024x1024 —— 常用尺寸,需满足边长 16 的倍数、总像素 655,360 至 8,294,400 之间、宽高比不超过 3:1 model:Image-2

写提示词的小经验 不用死记复杂提示词模板,用大白话描述画面就可以。

几点实操心得:

描述尽量把主体、风格、构图讲清楚。例如“一只白色猫咪坐在窗台上,水彩画风,暖光”,产出效果远好于简单的“画一只猫”。

如果画面要展示文字,直接把完整文案写进提示词。

想要照片写实质感,可以加上 photorealistic。

控制台内置不少现成风格样例,可以基于样例修改快速调试。

希望大家可以尝试,进行创作,分享。

以 AI 之力,筑未来之境

现在注册,立即免费获赠 200 次大模型调用权益

免费注册 →