开始体验前的三件事
这里的“深度体验”不是先写好一张研究计划,再给工具套分。每次只选一个具体工作,用可安全使用的材料实际操作,记下它做成了什么、没有做成什么,以及人工还要补什么。
- 先写清楚要完成的工作、所用模型与版本、Skill 版本、关键配置、输入材料和自己认定“做成”的标准。
- 不用真实案情、客户文件、身份材料、学校/机构账号或数据库凭据;优先用公开材料或为体验准备的样本。
- 把“工具实际输出了什么”和“我据此形成什么看法”分开写,不把一次顺利运行说成普遍结论。
100 分评分框架
分数只服务于某个具体工作,不是所有 Skill 共用的一把尺。下列五项构成总框架;不涉及法律结论或法源的执行型 Skill,会把第一项换成“输出完整性与正确性”。
| 法律内容与依据可靠性 | 35 |
|---|---|
| 任务完成质量与效率 | 25 |
| 稳定性与可复现性 | 20 |
| 数据、权限与使用边界 | 10 |
| 可访问性、成本与上手难度 | 10 |
| 总分 | 100 |
- 法律内容与依据可靠性:只用于检索、引用、分析等会产生法律判断的任务。看结论、引注或回链能否回到可靠依据;不是所有 Skill 都需要这一项。
- 任务完成质量与效率:它有没有把目标工作真正推进,输出是否可继续使用,花的时间和人工补做是否合理。
- 稳定性与可复现性:在同一模型、模型版本、Skill 版本、关键配置和输入条件下,换一组相近材料、重复运行几次后,能否持续完成;失败时会不会留下可发现、可修正的痕迹。
- 数据、权限与使用边界:需要上传什么、连接什么账号或数据库、依赖哪些权限,哪些材料不该交给它。
- 可访问性、成本与上手难度:能否获得、是否收费、配置和学习需要多少步骤,不预设某一个地区用户的答案。
不同模型的能力、工具调用和上下文处理可能明显不同。为便于比较,体验记录会写明所用模型、模型版本和关键配置;不同模型的结果会单列,不把一个模型上的体验外推到另一个模型。
只有在使用记录足够支撑比较时才给分。届时,80–100 可标为“可推荐”;60–79 为“谨慎使用”;59 及以下为“不推荐用于该任务”。分数只对应当时的模型、工具版本、任务和输入,不外推为所有法律问题的能力。
红线封顶
需要法源却虚构或无法回查、执行时篡改或丢失关键内容、要求上传真实敏感材料、关键权限/成本/依赖说不清,都会限制结论。红线不是机械扣分,而是告诉读者:即使别的地方做得不错,也不能把它当成可以放心依赖的工具。
体验记录与结论
起步阶段以编辑者自己的实际使用记录为主:具体怎么用、观察到什么、失败在哪里、还需要哪些人工判断。其他法律专业人士的体验可以补充,但会单列来源和角色,不强行平均成一个看起来精确的黑箱分数。
版本与更正
工具、模型或来源变化,或后来发现体验记录有误时,原结论应复核、修订或撤下。已经发布的结论会保留使用日期、模型与工具版本、关键配置和观察;不能再复现的分数不应继续展示。