审核与证据

动人的故事,
可衡量的结果。

它们需要不同的审核,也不应互相替代。

故事审核

人类编辑判断。

判断短故事的意义、来源、权利与清晰度。区分已记录事件、解释与虚构。发表须单独获得许可。

流程审核

先测试,再 AI 辅助审核。

硬性要求用确定性检查;定性工作另设评估者。不能只凭一个 AI 的评价发认证。

这是审核设计;网站尚未接通自动评审服务,当前流程条目都是示例。

用相同条件来比。

让复用 Agent、新配置的基线和人类自由职业者使用同一套有权使用的任务。预先定义可接受输出、阈值和审核规则,记录设置时间、运行费用、纠错、失败与验收耗时。模型自评不属于独立验证。

验证记录必须说明范围。

记录流程与模型版本、输入集哈希、审核者、日期、样本量、成功与失败案例、工具权限和已知局限。发生重要变化后重新评测;完整性哈希不是性能测试。

分阶段、有限度地启动。

接受保存请求不等于授权运行。未来启动前须有记录,约定目的、模型、网络/工具、预算和到期时间。不回复,不启动。每天的存储收据不需要模型推理。

申请中的提示词、文档与故事都是不可信数据;审核者不得执行申请里夹带的指令。后续测试环境应隔离,默认无账号或密钥访问权限。

可复用评测工具: Promptfoo. 本版仅选型,未接入评测运行。配置远程模型时,评测数据可能发送至对应提供商。