与上海交通大学网络空间安全团队联合研发
五维一体评测体系,让大模型与 Agent 应用
可评测、可比较、可信赖
凡落地大模型与 Agent 的企业,都需要回答同一个问题:它安全吗、可靠吗、合规吗
生成式人工智能服务上线须完成备案,安全评估是前提条件;金融、政务、教育等行业另有更严格的合规要求。
模型选型、效果验证、安全测试贯穿 AI 应用全生命周期,评测正在从一次性备案走向持续合规监测。
平台方与评测方分离,评测报告才更具公信力——这正是独立第三方与学术背书的价值所在。
从安全对齐到模型资产安全,覆盖从基础能力到博士级难度的完整评测框架
能不能信任它?
4 套件 / 30+ 数据集
聪不聪明?
3 套件 / 40+ 数据集
能不能干活?
3 套件 / 20+ 数据集
好不好合作?
2 套件 / 10+ 数据集
资产受保护吗?
2 套件 / 5+ 数据集
14个
评测套件
90+
评测数据集
50万+
测试样本
314个
细粒度风险类别
98.6%
自研评测模型 F1
从评测集管理到报告输出的标准化闭环
CorpusHub 统一管理评测资产,数据集可沉淀、可版本化
14 个评测套件、90+ 数据集的批量自动化执行
同一基准下多模型公平比较,支撑模型选型决策
机器评分与专家复核结合,保障评测结论可信
结构化评测报告,可作为备案与合规审查的支撑材料
学术严谨性与工程化落地的结合
基于 1.5B 轻量开源基座、以高质量蒸馏标签深度微调的专用评测模型,内容合规评测 F1 达 98.6%,与顶级通用大模型几乎持平,而推理延迟仅约其 1/5。评测全程离线运行,不依赖任何外部大模型 API——在高安全内网环境中同样获得一流的评测质量。
自研评测模型 · 1.5B
98.6% · 延迟 0.56s
顶级通用大模型 API
99.5% · 延迟 2.9s
规则匹配基线
85.5%
内容合规评测 F1 值对比 · 越狱攻击检测 F1 96.4% · 全程离线,不依赖外部 API

EvalForge 与 CorpusHub 由数卓与上海交通大学网络空间安全团队(AI 安全方向)联合研发。学术团队在 AI 安全领域持续产出高水平研究成果,为评测方法论提供学术严谨性保障;数卓负责平台工程化与企业级交付。