审核与证据动人的故事,
动人的故事,
可衡量的结果。
它们需要不同的审核,也不应互相替代。
故事审核
人类编辑判断。
判断短故事的意义、来源、权利与清晰度。区分已记录事件、解释与虚构。发表须单独获得许可。
流程审核
先测试,再 AI 辅助审核。
硬性要求用确定性检查;定性工作另设评估者。不能只凭一个 AI 的评价发认证。
这是审核设计;网站尚未接通自动评审服务,当前流程条目都是示例。
用相同条件来比。
让复用 Agent、新配置的基线和人类自由职业者使用同一套有权使用的任务。预先定义可接受输出、阈值和审核规则,记录设置时间、运行费用、纠错、失败与验收耗时。模型自评不属于独立验证。
验证记录必须说明范围。
记录流程与模型版本、输入集哈希、审核者、日期、样本量、成功与失败案例、工具权限和已知局限。发生重要变化后重新评测;完整性哈希不是性能测试。
分阶段、有限度地启动。
接受保存请求不等于授权运行。未来启动前须有记录,约定目的、模型、网络/工具、预算和到期时间。不回复,不启动。每天的存储收据不需要模型推理。
申请中的提示词、文档与故事都是不可信数据;审核者不得执行申请里夹带的指令。后续测试环境应隔离,默认无账号或密钥访问权限。
可复用评测工具: Promptfoo. 本版仅选型,未接入评测运行。配置远程模型时,评测数据可能发送至对应提供商。