GB/T 45288.2可信校验 · 国标全覆盖
标准符合性
完整覆盖国标 46 项能力检测
完整覆盖 GB/T 45288.2-2025《人工智能 大模型 第2部分:评测指标与方法》的 30 项理解能力与 16 项生成能力检测项。检测项、指标口径与报告结构与标准一一对应,评测结果可直接用于项目验收、合规审批与管理层汇报。
核心要点
5.1 理解能力 · 30 项5.2 生成能力 · 16 项MOS 8 维主观评测国标口径检验报告
检测项与标准条款一一映射,按国标口径组织模型、数据集与指标
每个检测项固化测试方案:数据集版本、指标定义与重复策略
一键输出符合国标口径的检验报告,直接用于验收、审计与汇报
GB/T 45288.2-202546 项能力检测项清单
检测项与标准条款一一映射,每个检测项固化测试方案:数据集版本、指标定义与重复策略。
理解能力 · 5.1(30 项)
- 5.1.2文本分类
- 5.1.3信息抽取
- 5.1.4数学推理
- 5.1.5因果推理
- 5.1.6常识推理
- 5.1.7任务分解
- 5.1.8文本问答
- 5.1.9多轮对话
- 5.1.10代码理解
- 5.1.11长文本理解
- 5.1.12静态图像分类
- 5.1.13静态图像分割
- 5.1.14目标检测
- 5.1.15动态图像分类
- 5.1.16行为识别
- 5.1.17声纹识别
- 5.1.18音频问答
- 5.1.19环境音分类
- 5.1.20图文检索
- 5.1.21静态图像问答
- 5.1.22视觉空间关系
- 5.1.23视觉语言推理
- 5.1.24视觉蕴含
- 5.1.25视频检索
- 5.1.26视频问答
- 5.1.27图表推理
- 5.1.28文音检索
- 5.1.29视频异常检测
- 5.1.30有声视频检索
- 5.1.31有声视频问答
生成能力 · 5.2(16 项)
- 5.2.2摘要总结
- 5.2.3机器翻译
- 5.2.4文本改写
- 5.2.5文本扩写
- 5.2.6文本续写
- 5.2.7代码生成
- 5.2.8半结构化数据生成
- 5.2.9文本生成图片
- 5.2.10图片生成文本描述
- 5.2.11文本生成视频
- 5.2.12视频生成文本描述
- 5.2.13文本生成有声视频
- 5.2.14有声视频生成文本描述
- 5.2.15语音合成
- 5.2.16语音识别
- 5.2.17语音翻译
常见问题国标检测常见问题
SwanJudge 覆盖 GB/T 45288.2-2025 的哪些检测项?
完整覆盖《人工智能 大模型 第2部分:评测指标与方法》的 30 项理解能力(5.1)与 16 项生成能力(5.2)检测项。检测项、指标口径与报告结构与标准一一对应,评测结果可一键输出为国标口径检验报告,直接用于项目验收、合规审批与管理层汇报。
检验报告包含哪些内容?
检验报告按国标口径组织,包含评测目标与环境、指标定义、多维结果与可视化、错误样例与改进建议,支持 Word / PDF / HTML / CSV 一键导出,并自动纳入版本管理与权限管控。
评测使用哪些权威基准数据集?
46 项检测项逐项预置推荐与备选数据集,包括 GSM8K、MATH、BBH、MMLU、CMMLU、C-Eval、HumanEval、MBPP、MT-Bench、LongBench、TruthfulQA 等学术界与产业界公认的基准。每个检测项标注数据集出处、版本与适用指标,并支持从 HuggingFace / ModelScope 一键接入。