retrieval-01
✓ PASS召回率0.92✓ >= 0.8
忠实度0.96✓ >= 0.9
延迟820 ms✓ <= 1200
一次 AI 发布,应该被放行还是拦截?
改一组数据,亲手做一次判断。
召回率、忠实度:0–1;延迟:毫秒。每条样本需有唯一 id。
每一条样本都满足当前规则。
这是基于 EvalForge 门禁思想编写的浏览器实验:接收已有分数,逐条与阈值比较。达到边界也算通过,任一指标不达标就拦截;无效输入会报错,不会被当成通过。
它没有评测真实模型,也没有运行 Python 版 EvalForge。示例中的分数用于说明规则;正式项目支持基线回归、CI 接入与多种报告格式。
阅读 EvalForge 源码与使用说明 ↗