AI视觉模型图片Base64编码工具
把图片编码为Base64 Data URI,按OpenAI公开公式估算GPT-4o图片token消耗,并列出GPT-4V/Claude 3/Gemini视觉模型的图片限制参考,专为AI视觉模型输入场景设计。
免费在线工具
Loading…
使用说明
- 点击上传区域选择图片,或直接拖拽图片到上传区域,也可以在下方输入框粘贴图片URL后点击「加载」。
- 图片加载成功后会显示预览图、原始尺寸、原始体积、Base64编码后体积,以及按 GPT-4o tile 算法估算的 token 消耗。
- 切换 low / high 两种检测模式查看不同模式下的 token 估算差异:low 模式固定消耗 85 token,high 模式按图片分块(tile)数量计算。
- 点击「复制 Data URI」把完整的 Base64 Data URI 复制到剪贴板,可直接粘贴进 GPT-4o/Claude 3/Gemini 等支持图片输入的对话框或 API 请求中。
- 下方表格列出主流视觉模型的图片体积/分辨率限制参考值,帮助你在上传前预判是否需要压缩。
- 点击「加载示例图片」快速体验完整流程;点击「重新上传」可以更换图片。
功能介绍
- 专为 GPT-4V/GPT-4o、Claude 3 Vision、Gemini Vision 等 AI 视觉模型的图片输入场景设计,与站内通用的 Base64 文件/字符串转换工具定位不同:本工具聚焦“图片编码 + 视觉模型 token 预估”这一特定场景。
- 支持本地上传、拖拽、粘贴图片URL三种加载方式,全部在浏览器本地用 FileReader/Canvas 完成编码,不会上传到任何服务器。
- 按 OpenAI 公开的 tile-based 算法估算 GPT-4o 图片 token 消耗:low 模式固定 85 token,high 模式按 512×512 分块数量计算(85 + 170×tile数)。
- 展示 Base64 编码后的体积大小,并提示编码后体积约比原文件大 33%。
- 汇总 GPT-4o、Claude 3、Gemini 三大主流视觉模型的图片体积与分辨率限制参考值。
使用场景
GPT-4o API 调用成本预估
上传即将发给 GPT-4o 的图片,提前估算 token 消耗,辅助预算调用成本,避免超预算调用。
视觉模型输入前置校验
上传图片前先查看体积和分辨率是否超出目标模型的限制参考值,避免调用时因图片过大被拒绝。
前端本地拼装多模态请求体
快速拿到图片对应的 Base64 Data URI,用于本地调试拼装 GPT-4V/Claude 3/Gemini 的多模态 API 请求体。
低成本 vs 高精度模式对比
对比 low/high 两种检测模式下的 token 差异,辅助决定业务场景该用哪种检测模式以平衡成本与识别精度。
常见问题
这个工具和站内的“Base64文件转换”“Base64字符串转换”有什么区别?
那两个是通用的 Base64 编解码工具,面向任意文件/文本;本工具专门针对图片,并且额外提供 AI 视觉模型(GPT-4o等)的图片限制参考和 token 消耗估算,是更聚焦的场景化工具,不是重复功能。
token 估算准确吗?
计算公式基于 OpenAI 公开文档的 tile-based 算法(low 固定85 token,high 按512×512分块 85+170×tile数),仅供参考,实际计费以 OpenAI 官方最新文档和账单为准。
图片会上传到你们的服务器吗?
不会,图片的读取、编码、预览全部在你的浏览器本地完成(FileReader + Canvas),本工具不会把图片发送到任何服务器。
为什么粘贴的图片URL加载失败?
常见原因是目标服务器没有开放 CORS 跨域访问权限,浏览器出于安全限制无法读取该图片内容,此时请改用文件上传方式。