# AdoptLab：试用观察与简历证据

## 未经测量的部分

当前没有已核实的外部真实用户试用记录。新版六次协议运行是自动化验收；浏览器操作是维护者自测。它们不计入真实参与人数，不支持采用率、节省人工时间或商业收益结论。旧版模型实验与新版协议记录分别保留，不合并成功率。

## 试用任务（等待真实参与后填写结果）

维护者任务：导入文档配置任务包，先发现一个错误字段，修正后登记新ID；执行任务，阅读轨迹和独立规则；提交反馈，修改材料后同条件复验，导出证据包。

接入开发者任务：不使用模型密钥，从环境检查进入内置首次任务；找到产物与验收结果；如果失败，说明失败位置并导出问题包。随后尝试已准备的Filesystem任务。Docker是第二个任务的必要依赖，不能阻碍内置首次成功。

观察者先取得同意，再创建匿名标识；记录开始/结束的带时区时间、目标任务、实际运行ID、帮助程度（无协助/提示/全程指导）、卡住的位置、用户原话、是否接受、证据引用与撤回状态。不要在公开导出中存姓名、联系方式或原始观察笔记。不得将观察者录入的来源标签当作已验证的外部身份。

访谈追问：最近一次接入MCP工具时，在哪个步骤卡住？用了哪些资料？如何判断任务完成？如何处理失败？已经改过哪些说明，怎样确认修改有效？避免询问“你愿不愿意用我们的工具”等未来意愿问题。

## 指标定义

| 指标 | 对象与分母 | 来源/限制 |
|---|---|---|
| 协议接受率 | 指定任务/材料/条件下接受的协议运行 ÷ 所有对应协议运行 | 独立规则与产物指纹；取消、超时、失败保留在分母 |
| 模型任务接受率 | 同条件模型运行中独立验收接受数 ÷ 所有对应模型运行 | 实际响应模型未知或不同则不合并；不是采用率 |
| 首次成功时长 | 观察到的任务开始到首个独立接受之间的时间 | 仅真实观察会话；自动执行耗时另列；记录帮助程度 |
| 修订验证状态 | 反馈关联了材料变化且同条件复验接受 | 修改材料本身不能成为已验证修订 |
| 观察会话数 | 有同意、有效时间、帮助级别和证据引用的去重观察记录 | 来源是录入者声明，不直接等于外部真实人数 |
| 费用上界 | 已有费用记录与未知请求的预留之和 | 预留不等于已结算费用；未知请求不自动重放 |

## 简历项目要点（根据已保存证据）

- 面向MCP工具维护者，把接入验证、错误证据、材料版本和同条件复验组织为连续工作流；保留FastAPI、SQLite与原生JavaScript，完成中英文14类工作台界面及Figma组件/原型，避免将模型评测与真实采用混为一谈。
- 实现只读任务预检、规则关联诊断、不可变材料修订和三态发布检查；通过内置记录、官方Filesystem与文档配置提取三个案例完成六次协议基线/修订运行，并分别核对字段值、引用位置及产物指纹。[新版证据](workbench-evidence.json)
- 保留历史模型对照实验的原始分母，新增脱敏公开案例浏览与报告下载；对产物篡改、材料不匹配、执行条件变化、迁移与未知费用设置验收边界。真实试用收益目前未测量，准备观察任务与匿名台账后再验证。[历史实验](experiment-results.md)

以上是独立项目经历，不包装为任职公司或客户上线经历。测试数量及发布状态应从最终检查记录引用，不在简历中填写未完成的数字。

## 项目追问材料

**为什么不做通用知识库？** 当前资源是MCP实现和开源维护，能触达的问题更具体。企业知识库需要授权语料、权限和真实问答；工具接入可先建立明确任务契约和独立验收。

**与Promptfoo、Langfuse相比有什么价值？** 它们已有评测与实验能力。AdoptLab强调从接入材料到失败、修订理由和复验记录的关系；不宣称竞品缺少评测，也不把工作台页面数量当用户价值。

**为什么诊断不用自动修复Agent？** 现有错误码、轨迹和验收规则能够支持可解释的证据关联。再增加自动修复会引入改动授权、误修和新的验收需求；本版由维护者作修订决策。

**六次运行证明了什么？** 三个任务各有一次基线和一次修改材料后的协议接受，支持功能闭环。协议执行使用参考步骤，因此不能证明材料改善模型行为；模型效果仍看独立模型实验。

**如何保证比较可靠？** 冻结任务、执行设置、模式和工具配置，记录条件指纹与实际响应模型；不匹配则阻止验证修订及汇总比较。材料变化是允许比较的变量。

**为什么不迁移前端框架？** 当前主要风险是行为闭环、验收和证据口径，现有技术栈足够支撑；迁移会增加成本但尚无对应收益证据。

**保存与发布如何确认？** Figma节点导出只能证明本地导出成功，云端保存单独核对；GitHub提交、CI与线上资源哈希分别检查。公开站点展示保存证据，不暴露本地执行服务。

**真实用户收益怎么验证？** 先观察过去接入行为，再按上述任务观察无协助/提示/指导会话。记录失败和未完成，避免把自动化测试人数、模型成功率或课程案例百分比写成采用收益。
