OpenAI微调数据集JSONL校验器
在线校验OpenAI Fine-tuning Chat格式JSONL数据集,逐行检测messages结构、role合法性、user/assistant消息完整性,并统计样本数与估算token数。
免费在线工具
Loading…
使用说明
- 将JSONL数据集内容粘贴到输入框,或点击“上传文件”选择本地.jsonl文件
- 点击“校验”(或直接粘贴后自动触发),工具会逐行解析并按OpenAI微调Chat格式要求逐一检测
- 顶部统计区展示总行数、校验通过/失败行数、总消息数、估算总token数
- 下方逐行结果列表展示每一行的通过/失败状态;失败行会具体列出错误原因(如“第3行:messages[1].role 不是合法值”)
- 点击“加载示例JSONL数据集”可快速查看包含正确样本与多种错误样本的效果演示
功能介绍
- 专项校验OpenAI Fine-tuning Chat格式:要求每行是一个JSON对象,必须包含messages数组
- 逐条校验message结构:role字段必须是system/user/assistant之一,content字段必须是字符串;整行必须至少包含一条user消息和一条assistant消息
- 逐行精确报错:报告具体行号+具体字段路径(如messages[1].role、messages[0].content),而非笼统提示“格式错误”
- 统计总行数、校验通过/失败行数、总消息数、估算总token数(近似算法:英文约4字符/token,中文约1.7字符/token,标注为近似值非精确tokenizer结果)
- 与站内jsonl-viewer工具的区别:jsonl-viewer是通用JSONL查看/搜索/树形浏览工具,不做任何格式校验;本工具是专门针对OpenAI微调数据集Chat格式的规则校验器,不提供树形浏览、搜索等通用查看功能
使用场景
微调数据集提交前预检
在上传到OpenAI微调平台前,先用本工具校验JSONL文件格式,避免因格式错误导致任务提交失败
排查具体哪一行数据有问题
数据集文件较大时,快速定位到具体行号和字段路径,而不用逐行人工比对格式要求
估算微调数据集的token规模
提交微调任务前粗略估算数据集总token数,辅助评估训练成本或是否需要精简数据
检查是否缺少必要的对话角色
验证每条训练样本是否都包含完整的user提问和assistant回复,避免只有单方消息的无效样本
常见问题
这个工具和站内已有的jsonl-viewer有什么区别?
jsonl-viewer是通用JSONL查看器,提供树形浏览、搜索、原始/格式化切换等通用查看功能,不校验任何具体业务格式;本工具是专门针对OpenAI微调(Fine-tuning)Chat数据集格式的规则校验器,只做格式合规性检测(messages结构、role合法性、user/assistant完整性等),不提供通用树形浏览和搜索功能。两者定位不同,可配合使用。
token数统计准确吗?
不完全准确,是近似估算值。采用英文约4字符/token、中文约1.7字符/token的经验换算规则,与OpenAI官方tokenizer(如cl100k_base)的实际结果会有一定偏差,仅供规模参考,不能作为计费或训练成本的精确依据。
支持哪些角色(role)?
仅支持OpenAI Chat格式规定的三种角色:system、user、assistant,其他角色名(如function、tool等)会被判定为不合法。
文件中的空行会被当作错误吗?
不会。工具会自动跳过完全空白的行(不计入总行数统计),不会因为文件末尾的空行或行间空行报错,但报错行号仍按文件中的实际物理行号显示,方便在编辑器中定位。