BENCHMARKS可信校验 · 权威基准
评测权威性每项指标都有权威基准背书
为每一项测试指标准备大量精心挑选、在学术界与产业界具备公认度的基准数据集——GSM8K、MMLU、C-Eval、HumanEval、MT-Bench 等尽数预置。评测结果有权威出处,经得起厂商与第三方质询。
核心要点
GSM8K · MATHMMLU · CMMLU · C-EvalHumanEval · MBPPMT-Bench · LongBench · TruthfulQA
46 项检测项逐项预置推荐与备选数据集,选型即用、无需自行搜集
每个检测项标注数据集出处、版本与适用指标,评测结论可溯源
在线数据源一键接入:HuggingFace / ModelScope 自动下载与校验
权威基准预置基准数据集
每个检测项标注数据集出处、版本与适用指标,并支持从 HuggingFace / ModelScope 一键接入在线数据源。
| 能力方向 | 代表基准 | 预置基准 | 样本规模 |
|---|---|---|---|
| 数学与复杂推理 | GSM8K · MATH · BBH | 3 套 | 27K+ |
| 知识与中文学科 | MMLU · C-Eval | 3 套 | 40K+ |
| 代码与对话质量 | HumanEval · MT-Bench | 4 套 | 5K+ |
CUSTOM DATA可信校验 · 定制数据集
行业定制服务把业务场景固化为评测标尺
通用基准之外,支持为企业特定业务场景定制专属评测数据集,并提供复杂场景数据的合成与优化——能源调度问答、金融合规风控、医疗术语理解,都能沉淀为可复用的验收标尺。
核心要点
行业场景梳理数据合成与优化多版本管理订阅式更新
与企业共建行业评测集,覆盖真实业务场景与边缘输入
复杂场景数据自动合成加人工精修,弥补真实语料不足
数据集动态订阅更新与完整性校验,评测标尺随业务演进
行业定制行业定制场景示例
通用基准之外,与企业共建行业评测集,覆盖真实业务场景与边缘输入,并通过数据合成与人工精修弥补真实语料不足。
- 能源 · 调度知识问答
- 金融 · 合规风控判断
- 医疗 · 临床术语理解
常见问题评测数据集常见问题
评测使用哪些权威基准数据集?
46 项检测项逐项预置推荐与备选数据集,包括 GSM8K、MATH、BBH、MMLU、CMMLU、C-Eval、HumanEval、MBPP、MT-Bench、LongBench、TruthfulQA 等学术界与产业界公认的基准。每个检测项标注数据集出处、版本与适用指标,并支持从 HuggingFace / ModelScope 一键接入。
可以为我们的业务场景定制评测数据集吗?
可以。SwanJudge 与企业共建行业评测集,覆盖真实业务场景与边缘输入,通过复杂场景数据自动合成加人工精修弥补真实语料不足,并以订阅式更新让评测标尺随业务演进,例如能源调度问答、金融合规风控和医疗术语理解。