use-case
图像生成与视觉模型指南
直接答案视觉理解与图像生成是两类接口;生成项目要分别验证提示遵循、编辑一致性、文字、人物权利、安全审核和输出许可。
更新 · 审核信息
区分理解与生成
把图片发给多模态聊天模型是“看图并输出文本”;让模型创建或编辑图片是专用 Images/媒体任务。两者的模型、计费、输入格式和安全限制不同,不能因为都叫视觉而共用请求。
输入设计
明确是文生图、图生图、局部编辑还是多参考一致性,并记录宽高比、尺寸、输出格式、种子和参考权重。输入图片要限制大小、类型和下载来源,不能让服务端抓取任意 URL。
API 工作流
同步接口直接返回图像或 URL;异步接口返回任务 ID,需要幂等创建、有界轮询、终态处理和结果转存。Base64 会显著增加内存与日志体积,高并发服务优先流式上传和对象存储。
如何评测
用固定提示与参考素材评估构图、主体一致性、手部、文字拼写、品牌色、编辑区域保持和多样性。自动指标只能筛选,人审仍是创意质量与权利风险的关键环节。
安全与权利
核验输入版权、人物同意、商标、敏感内容和厂商输出条款。不要把模型生成当成权利保证;保存提示、模型版本、审核结果和人工批准记录。
适用场景
- 图像理解与 OCR
- 文生图与编辑
- 品牌素材生产
API 协议
/v1/chat/completions/v1/images/generations
FAQ
上传图片让模型分析和让模型生成图片是同一个接口吗?
通常不是。视觉理解把图片作为多模态对话输入并返回文本,生成或编辑图片使用 Images/媒体端点;请求结构、模型、计费和审核规则都可能不同。
图片 API 返回 URL 或任务 ID 后就完成了吗?
不一定。任务 ID 只表示异步任务已受理,需要查询到成功终态;返回 URL 也可能是短期临时地址,应校验媒体类型和大小后尽快流式转存到受控对象存储。
怎样控制图片生成的费用和内存占用?
限制尺寸、张数、并发和失败重试,并按需求选择质量档位。Base64 会放大响应和日志体积,高并发服务优先使用流式上传、URL/对象存储,避免整批图片常驻内存。
如何评测生成图片,模型输出是否天然可以商用?
用固定提示和参考图检查提示遵循、主体一致性、文字、编辑区域与品牌色,并保留人审。模型输出不是权利保证;必须核对输入版权、人物同意、商标、内容审核和厂商输出条款。
关联指南
官方来源
- OpenAI Models Official
- BFL API Official
兔子API