INTERACTIVE LAB / 01

这一次,
由你设定标准。

一次 AI 发布,应该被放行还是拦截?
改一组数据,亲手做一次判断。

背后的项目:EvalForge ↗
浏览器内运行 · 无需密钥 · 数据不上传可编辑样例,不调用模型

01 输入与规则

INPUT
载入样例

召回率、忠实度:0–1;延迟:毫秒。每条样本需有唯一 id。

02 判定与证据

OUTPUT
✓ ALL CHECKS PASSED

可以放行。

每一条样本都满足当前规则。

3 / 3样本通过

retrieval-01

✓ PASS
召回率0.92 >= 0.8
忠实度0.96 >= 0.9
延迟820 ms <= 1200

answer-02

✓ PASS
召回率0.86 >= 0.8
忠实度0.94 >= 0.9
延迟1050 ms <= 1200

citation-03

✓ PASS
召回率0.9 >= 0.8
忠实度0.98 >= 0.9
延迟640 ms <= 1200
这个实验,究竟验证了什么? +

这是基于 EvalForge 门禁思想编写的浏览器实验:接收已有分数,逐条与阈值比较。达到边界也算通过,任一指标不达标就拦截;无效输入会报错,不会被当成通过。

它没有评测真实模型,也没有运行 Python 版 EvalForge。示例中的分数用于说明规则;正式项目支持基线回归、CI 接入与多种报告格式。

阅读 EvalForge 源码与使用说明 ↗