🔍 智能视觉分析
支持对象识别、场景理解、文字提取、情感分析等多种视觉任务,让 AI 真正”看懂”图片。
支持对象识别、场景理解、文字提取、情感分析等多种视觉任务,让 AI 真正”看懂”图片。
🌟 核心特性
- 🎯 多模型支持:Gemini 3 系列、GPT-5 系列、Claude 4 系列等顶级多模态模型
- 📸 灵活输入:支持 URL 链接和 Base64 编码图片
- 🌏 中文优化:完美支持中文场景理解和文字识别
- ⚡ 快速响应:高性能推理,秒级返回结果
- 💰 成本可控:多种模型选择,满足不同预算需求
📋 支持的视觉模型
以下为当前主流的多模态模型推荐,模型 ID 可能随版本更新,请以控制台为准。绝大多数对话模型现已支持多模态识图:上表仅为常用推荐,并非全部。GPT-5 系列、Gemini 3 系列、Claude 4 系列、Grok 4、Qwen、GLM、Kimi 等主流模型大多已支持图像输入。
- 📚 完整模型清单与特点对比:当下热门模型(保持更新)
- 🔗 实时模型列表与价格:API易控制台定价页面(以控制台显示是否支持视觉为准)
🚀 快速开始
1. 基础示例 - 图片 URL
2. 本地图片示例 - Base64 编码
3. 高级示例 - 多图对比分析
4. cURL 示例(命令行)
图片 URL 方式:5. 常见错误:图片 URL 下载超时
使用图片 URL 方式时,如果收到如下错误:- 图床 / 源站响应慢,或对部分地区网络访问不友好
- 图片体积过大,下载耗时超出限制
- URL 设有防盗链、需要登录或非公开直链
- ✅ 改用 Base64(data URI)方式上传(推荐,见上方示例 2)——图片数据随请求体直接提交,彻底绕开下载环节,最稳定
- 更换为响应更快、可公开访问的图片直链
- 压缩图片后重试
6. 常见错误:invalid base64 data(URL 误放进 Base64 字段)
如果收到如下 400 错误(以 Claude 系模型为例,其它模型系列文案略有差异,关键特征是invalid base64 data):
data:image/...;base64, 前缀后面必须是图片文件本身的 Base64 编码字符串,而不是图片链接。URL 方式和 Base64 方式是两种互斥的传参形式,不能混拼。常见诱因:代码里统一走了 data URI 拼接逻辑,遇到 URL 图片也直接拼了进去。
正确写法对照:
7. 常见错误:声明的图片格式与实际格式不符(media type mismatch)
如果收到如下 400 错误(关键特征是The image was specified using the image/png media type, but the image appears to be a image/jpeg image):
Bedrock Runtime: InvokeModel, ValidationException 表示请求已到达 Claude 系模型的上游通道,在参数校验阶段被拒绝)。它的意思非常直白:
- 你在 data URI 里声明图片是 PNG(
data:image/png;base64,...) - 但上游解码 Base64 后检查文件头(magic bytes),发现实际内容是 JPEG
- 声明与实际不一致 → 400 拒绝。Base64 编码本身没有问题,问题出在前缀里的 media type 写错了
- 按文件扩展名推断 MIME 类型,但扩展名是假的——文件名叫
xxx.png,实际是别人改过后缀的 JPEG(下载工具、聊天软件、截图工具都可能干这事) - 代码里写死了
image/png(或写死image/jpeg),不管传什么图都用同一个前缀 - 图片经过某些处理管道后格式变了,但文件名没变
🎯 常见应用场景
1. 商品识别与分析
2. 文档 OCR 识别
3. 医学影像辅助分析
4. 安全监控场景分析
💡 最佳实践
图片预处理建议
- 格式支持:JPEG、PNG、GIF、WebP 等主流格式
- 大小限制:建议单张图片不超过 20MB
- 分辨率:高分辨率图片会获得更好的识别效果
- 压缩优化:适度压缩以提高传输速度
提示词优化
错误处理
🔧 高级功能
1. 流式输出
对于长篇分析,可以使用流式输出获得更好的用户体验:2. 多轮对话
保持上下文进行深入分析:3. 结合函数调用
📊 性能对比
🚨 注意事项
- 隐私保护:不要上传包含敏感信息的图片
- 合规使用:遵守相关法律法规,不用于非法用途
- 结果验证:AI 分析结果仅供参考,重要决策需人工复核
- 成本控制:合理选择模型,避免不必要的开销