免费|轻量测试包
添加 CC 助理栗子
轻量包可在本页直接下载;也可添加助理,按指引加入交流群。
- 1 份虚构脱敏合同
- 统一任务与 30 分钟说明
- 答案卡、100 分评分和四档使用决定
找到 26 个公开候选,实际安装或运行 9 个,留下 34 次过程记录。
Agent 是能读取文件并按步骤完成任务的 AI 工作环境;Skill 可以先理解为“给这个 AI 加上的合同审核说明书和工作步骤”。真正要判断的不是它会不会说“能审合同”,而是:加上以后是否比不加载 Skill 的基础组更好,优势能否在不同合同上重复出现,发现的问题是否真的写进 Word 合同。
本报告沿用 No.01 的三份虚构脱敏测试合同和法律评价逻辑。区别在于,本期从评测原生 Agent 转向评测公开可获得的合同审核 Skill。报告解释结论;轻量包让读者自己跑一次;会员完整包提供三份合同、6 种配置 × 3 份合同的 18 次对比、原始输出和进阶复测材料。
| 全球候选筛选 | 从 GitHub、主流 Agent/Skill 生态与中英文公开项目中,筛出真正能识别合同风险、分析条款或直接修改合同的 26 个候选。 |
| 版本与许可核验 | 记录项目入口、更新时间、GitHub 关注数与派生数、许可证和安装方式;许可证不作为学习门槛,但单列商业使用边界。 |
| 连续任务实测 | 沿用 No.01 三份合同,用 6 种配置各审 3 份合同,共完成 18 次核心比较。 |
| 法律专家判定 | 从委托方、事实、风险与适用法律地区、合同修改是否完整、谁来接手五个角度,判断能否进入真实流程。 |
| 配置与选型 | 根据失败位置,判断该补审核说明书、机构规则册、法律检索工具、Agent 工作环境还是人工批准。 |
| 复跑材料 | 提供 30 分钟轻量测试;会员包再提供三份合同、原始证据、基础组—Skill 对照模板和持续复测材料。 |
9 数的是实际动手验证的项目;34 数的是每一次安装、运行或受阻过程。同一个项目可能测试不同合同、不同配置,或进行一次纠正性运行,因此会留下多条记录。18 是其中最核心、条件最一致的一组比较:6 种配置各审 3 份合同。
边界:本期结果来自特定版本、固定任务和单次正式运行,不构成永久排名、采购背书或具体法律意见。静态数据截止 2026-09-03;动态证据截止 2026-09-05。
26 个候选中,6 个主要面向中文合同,7 个是国际或通用 Skill,13 个是多步骤完整系统。能输出中文,不等于已经理解一家机构在具体合同上的业务目标、底线和退让规则。
18 次核心比较中,Anthropic 发现的风险最多,为 58/59;基础组与 Anthropic 真正写进合同且没有被其他条款抵销的问题最多,并列 43/59。但 6 种配置都只让 3 份合同中的 1 份达到人工谈判准备最低线。
Contract Copilot 在猎头合同中把保证、免责和退款条款改成了一套不冲突的机制;code-lawyer 帮助多发现了一些问题;Anthropic 更少误改。三者提供的是不同能力,不适合压成一张总榜。
基础组使用同一个 Agent 和模型,但不加载审核 Skill。它帮助判断进步究竟来自 Skill,还是来自 Agent 本身。Skill 的价值也可能表现为少误改、修改更聚焦、发现真正写进合同,而不是总分必然上升。
交付格式、审核规则、少误改能力、机构合同规则册、全文一致性、Word 质量检查和人工签发需要组合。先用一份合同判断是否有帮助,再决定是否投入三份合同的完整对照测试。
开源合同审核 Skill 已经能在特定法律问题上提供可观察的帮助,但尚没有一个项目能在三类合同上稳定解决全部关键风险;真正值得投入的不是“冠军名称”,而是一套能重复测试、能找到责任人的组合方法。
候选项目清单、明确版本说明、安装与运行记录、三份连续性合同、6 种配置 × 3 份合同的保存结果、Word 修订稿、专家校准答案、法律评价卡、避免误改检查和纠错过程。正文只展示足以改变使用判断的证据,完整记录进入会员包。
| 术语 | 本报告中的含义 |
|---|---|
| 审核 Skill | 给 AI 加上的合同审核说明书和工作步骤,包括看什么、怎样判断、怎样修改和怎样交付。 |
| 机构审核规则册 | 一家机构针对某类合同形成的立场、业务参数、条款底线、退让路线、全文关系和审批规则;技术圈常称为 playbook。 |
| 基础组 | 使用同一个 Agent、同一模型、同一合同和同一任务,但不加载被测 Skill。它只是判断 Skill 是否有效的对照组。 |
| 真正写进合同 | 问题不只出现在报告里,还变成可执行条款,并且没有被其他条款重新抵销。 |
| 放行最低线 | 只要关键风险、事实边界、合同修改或人工责任有一项没过,就不能进入谈判准备;平均分再高也不能补回来。 |
本期不把项目介绍中写着“能审合同”当作能力证据。候选先经过定向筛选,再判断是否只看公开材料、实际安装运行,或记录无法继续的原因。
项目公开可获得,而且确实提供合同风险识别、条款分析、合同修改或审核步骤。限制性许可和没有明确许可的项目可以用于学习观察,但需要醒目标记。
纯闭源 SaaS、纯聊天模板、普通法律 RAG、仅合同生成器和只有通用 Agent 声明而没有合同审查入口的项目。
第一类是中文或本土合同 Skill;第二类是国际或通用合同 Skill;第三类是包含读取、分析、修改和导出等多个步骤的完整系统。
9 个项目共留下 34 次安装、运行或受阻记录,其中 28 次产生了合同审核结果,6 次在下载项目或调用外部模型前停止。同一项目可能因不同合同、配置或纠正性运行留下多条记录。
| 任务 | 代表立场与业务目标 | 主要考察 |
|---|---|---|
| P1-001 市场推广 | 弱势甲方;新品按指定时间和渠道发布。 | 业务日历、正文—附件联动、窗口前救济。 |
| P1-002 猎头采购 | 服务购买方;费用与实际服务价值匹配。 | 有效推荐—入职—付款—保证—替换—退款链。 |
| P1-003 运营外包 | 服务购买方乙方;谈判地位均衡。 | 直接管理、人员成本、退出迁移、数据和责任链。 |
每种精确条件只正式运行了一次,因此还不能判断多次运行是否稳定;专家校准答案只适用于本次三份合同;LibreOffice 兼容检查不能替代 Microsoft Word 的全面检查;真实客户合同、其他国家或地区法律和真实机构审核规则册的表现仍然未知。
合同审核 Skill 的价值不在“说了多少”,而在是否把委托目标、事实、风险、条款和责任连接成一条可以复核的法律交付链。
| 步骤 | 最低要求 | 常见伪通过 |
|---|---|---|
| 1. 立场 | 保护正确的委托方和交易目标。 | 为了“公平”反向削弱委托方。 |
| 2. 定位 | 指向真实条款、附件或缺失材料。 | 只给通用风险标题。 |
| 3. 论证 | 解释风险发生机制和后果。 | 堆法条或结论。 |
| 4. 处理 | 写入修订、删除、新增或阻断动作。 | 只在报告里“建议修改”。 |
| 5. 全文 | 相邻条款、定义、附件和例外不抵销。 | 主条款改了,另一条又放开。 |
| 6. 交接 | 未知、参数和剩余风险交给明确责任人。 | 笼统写“请人工复核”。 |
| 指标 | 回答什么 | 不能说明什么 |
|---|---|---|
| 发现风险 /59 | 29 个加权问题中看到了多少。 | 不说明是否真的改进合同。 |
| 真正写进合同 /59 | 多少问题变成有效条款,而且没有被其他条款抵销。 | 不能掩盖关键风险仍未解决。 |
| 是否达到放行最低线 | 这次输出能否进入人工主导的谈判准备。 | 不是对产品的永久评级。 |
站错委托立场、虚构决定性事实或法源、漏掉事先确定的关键风险、报告意见没有写进最终合同、违反数据边界。平均分再高也不能补回来。
下表使用 29 个加权问题、59 总权重。百分比只描述本次三份虚构脱敏测试合同,不是现实世界准确率。
| 测试配置 | 发现风险 /59 | 真正写进合同 /59 | 解决关键风险 /5 | 达到最低线的合同 | 避免误改* |
|---|---|---|---|---|---|
| 基础组(不加载 Skill) | 52(88.1%) | 43(72.9%) | 3 | 1/3 | 90.9% |
| Contract Copilot | 51(86.4%) | 21(35.6%) | 2 | 1/3 | 86.4% |
| code-lawyer | 55(93.2%) | 41(69.5%) | 3 | 1/3 | 90.9% |
| pa1nrui1 | 53(89.8%) | 40(67.8%) | 2 | 1/3 | 95.5% |
| contract-review-pro | 53(89.8%) | 40(67.8%) | 3 | 1/3 | 100% |
| Anthropic review-contract | 58(98.3%) | 43(72.9%) | 2 | 1/3 | 100% |
* “避免误改”检查的是 11 个本来不应该删除、扩大或绝对化处理的地方,不代表现实使用中不会误判或乱改。
code-lawyer 达到 55/59,说明写清审核规则和步骤,可以帮助 Agent 多看到一些问题;但新增发现没有全部写进合同。
Contract Copilot 是 P1-002 唯一达到放行最低线的方案,说明 Skill 能改变单份合同的使用结论。
Anthropic 发现 58/59,11 项“避免误改”检查全部通过,适合作为通用对照,但不能替代中国合同的机构审核规则册。
基础组使用同一个 Agent 工作环境、同一模型、同一合同和同一任务,唯一差别是不加载被测 Skill。基础组本身已经发现大部分问题时,总发现数很难继续拉开差异;此时更要看 Skill 是否减少遗漏、减少乱改、让修改更聚焦,并把报告意见真正写进合同。基础组只是一把对照尺,不是最终推荐。
Counsel OS 没有取得可固定的公开代码版本;lowtide 完成前置处理后,需要外部模型才能继续;ContractAuditAgent 的离线规则可以运行,但没有命中本次专家答案中的问题。因此,本次无法证明“完整系统比单个 Skill 更好”。不能把没完成测试记成法律能力 0 分,也不能把项目介绍当成真实审核结果。
唯一不可失守的目标是:新品必须在指定时间、指定渠道统一发布。一般免责、违约金和风险数量都不能替代窗口前保护。

六组均未完整关闭正文—附件的统一解禁链,也共同漏掉国庆假期压缩。部分方案发现媒体替代、资源降档和救济,却没有形成“真实业务日历—提前锁位—窗口前替代”的完整保护。
业务应确认上市日、解禁时刻、核心媒体与假期排期;法务把正文、附件、替代资源和窗口前补救措施联动。这个共同缺口首先需要市场推广合同的机构审核规则册,而不是再叠加一张通用风险清单。
通用合同审核 Skill 往往擅长责任、付款、知识产权和合规,却不知道这笔交易唯一不可失守的是业务日历。机构审核规则册的价值,是把“什么时候失败、什么时候补救已经太晚”写成前置检查和条款关系。
这份合同的难点不是发现费率不利,而是让有效推荐、实际入职、阶段付款、保证期、主动离职、免责、替换和退款成为一套一致机制。

6 种配置都发现了全部加权问题,只有 Contract Copilot 把保证范围、排除原因、优先关系和举证责任改成一套不冲突的机制。它成为唯一让这份合同达到人工谈判准备最低线的配置。与不加载 Skill 的基础组相比,它在 P1-002 的原始法律分上增加 5.5 分;把关键风险是否解决考虑进去后,最终法律分增加 18.5 分。
这证明 Skill 可以产生足以改变签约判断的专项帮助。它仍不能替 HR、采购、财务和法务决定费率、保证期、退款比例、关联方范围和合同终止后的遗留责任。
适用边界:一次合同上的成功不能外推为跨合同冠军。Contract Copilot 在三份合同中的原始法律分均值为 59.7,基础组为 62.3;两者都只让 3 份合同中的 1 份达到放行最低线。
第一次结果与后来一次纠正性运行看似矛盾,实际上说明:“Skill 里的审核方法有没有价值”和“它能不能稳定写进最终合同”必须分开判断。

报告列出 20 个问题,但最终 Word 只有少量修订痕迹,多数意见停留在报告或批注,“真正写进合同”得分为 0/24。这说明从报告到合同修改的环节失败,不等于它完全不会发现法律问题。
固定到同一个代码版本,再用最少的连接步骤运行一次,完成了 42 组条款写入,实现 24/24 发现、22/24 写进合同,与基础组持平;对人员退出成本和不可抗力的处理也更合理。
采用前核对“报告发现—修改计划—批注—最终条款”是否一致;还要事先写清测试条件,再用同一份合同重复测试。一次失败不能否定 Skill,一次成功也不能证明它稳定。
以下判断只针对本期固定版本与三份合同,用于任务匹配,不构成长期排名。
从审核、修改到意见书的交付结构;在猎头合同中解决了保证、免责和退款条款互相冲突的问题。
换合同后是否仍然稳定、报告意见是否都写进合同、Word 是否兼容、是否加入机构审核规则册;CC BY-NC 限制商业复用。
中国规则来源、审核计划和可追溯的合同修订;发现风险提高到 55/59,适合研究怎样把审核规则写清楚。
多发现的问题没有自动变成全文一致的合同修改,需要继续检查正文与附件是否冲突。
会保留信息不足之处,通用风险发现较多,也较少误改;发现 58/59、真正写进合同 43/59,11 项避免误改检查全部通过。
对中国合同关键风险、中文条款表达和机构参数覆盖不足;适合作通用对照,不能替代本地审核规则册。
contract-review-pro 的 11 项避免误改检查全部通过;pa1nrui1 在部分中文合同上表现较好;Rohas 对委托方和条款位置写得清楚。
许可证不清、换合同后波动、报告意见没有稳定写进合同,或修改后仍有条款冲突,都需要继续验证。
GitHub 关注数合计 34,404,派生数合计 4,903。12 个项目在 30 天内更新,18 个在 90 天内更新;其中 21 个项目可以取得精确更新时间。
| 维度 | 本期分布 | 怎样解释 |
|---|---|---|
| 许可证 | MIT 13;Apache-2.0 5;CC BY-NC 1;FSL 1;未知 6 | 不影响学习比较,影响修改、再分发和商业使用。 |
| 别人能否按说明复跑 | A 级 7 个;B 级 14 个;C 级 5 个 | A 表示入口较完整,C 表示缺少关键步骤;都不等于法律能力已经验证。 |
| 先研究谁 | 关注度、近期更新、与合同审核的相关程度、复跑难度 | 只用于安排研究顺序;直播展示效果不进入研究评分。 |
采集日:2026-09-03。许可证按固定仓库可见文件记录;README 自称 MIT、无 LICENSE 与 NOASSERTION 均保留为待核验状态。
“Skill 没有帮助”或“基础组更强”都不是足够精确的结论。先找到问题发生在哪一步,再在下一轮只改变一个条件。
| Contract Copilot | P1-002:保证—免责—退款机制链。 |
| code-lawyer | P1-001:发布窗口与正文—附件联动。 |
| Anthropic | P1-003:未知事实和避免误改。 |
用 Contract Copilot 研究怎样交付报告和合同修改,借鉴 code-lawyer 的审核规则和可追溯修订,吸收 Anthropic 少误改、会保留未知事实的优点,再加入机构自己的中国合同审核规则册、全文一致性检查、Word 质量检查和人工签发。这个组合尚未实现或验证。
数据红线失败、输出无法检查或总分低于 50。只能排查安装和配置。
50—69 分,或关键红线没有通过。由律师重新分析。
70—84 分且红线通过。必须逐项人工复核。
85—100 分、红线通过、Word 稳定,并在多份同类合同上重复通过。
第一次只测试 P1-003 客户运营支持外包合同。它能同时观察直接管理、人员成本、退出迁移、数据和责任链,也最容易暴露“报告有、合同没改”。
| 配置项 | 记录内容 |
|---|---|
| 使用哪个 AI 工作环境 | 记录具体产品入口和可见版本。 |
| 使用哪个模型 | 记录模型名称、日期和可见版本。 |
| 使用哪个 Skill | 记录项目网址,并固定到同一个代码版本。 |
| 外部工具、网络和历史记忆 | 默认关闭;如果开启,要明确记录。 |
| Word 能力 | 能否读取原始 DOCX 并输出原生修订与批注。 |
| 人工干预 | 是否补充法律思路、修复工具或提供答案。 |
代表购买服务的乙方,要求在原始 Word 合同上完成修订,另列事实假设、待确认项和需要谁接手。
不要提供评分卡、研究报告、其他项目输出或隐藏风险清单;只运行一次,不自动重试。
| 维度 | 权重 | 满分信号 |
|---|---|---|
| 该发现的问题发现了多少 | 20 | 对照公开 10 项答案逐项定位。 |
| 有没有误判或乱改 | 10 | 不站错委托立场,不机械删除,不把条件问题改成绝对规则。 |
| 条款定位 | 10 | 回到准确条款、附件或缺失材料。 |
| 理由与依据 | 10 | 解释发生机制,依据真实适用,未知保留。 |
| 修改建议是否能直接谈 | 15 | 给出可执行的替换文本,也说明可以退让到哪里。 |
| 合同前后是否一致 | 15 | 正文、定义、附件、例外、责任与退出没有互相冲突。 |
| 适用法律和事实是否说清 | 5 | 区分合同里写明的事实、任务补充、假设和未知。 |
| Word 是否稳定 | 5 | 原始文件能打开、修订可以追踪、失败后可以恢复。 |
| 速度与安装 | 5 | 30 分钟内完成,无临时补丁。 |
| 隐私与人工责任 | 5 | 数据路径透明,发送签署和参数留给人。 |
是否站对委托方、是否虚构决定性事实或法源、两个关键风险是否真正解决、报告意见是否写进合同、是否违反数据边界。数据边界失败直接判为“不可用于任务”;其他红线失败最多只能“作为风险线索”。一份合同即使高分,也不能直接投入使用,还要再用至少两份同类合同验证,并在版本更新后复测。
26 个候选有公开合同审核入口;9 个项目被实际安装、运行或记录受阻原因;共留下 34 次过程记录;6 种核心配置都只让 3 份合同中的 1 份达到人工谈判准备最低线;完整系统组没有形成可公平比较的审核结果。
Contract Copilot 值得研究交付格式,code-lawyer 适合研究怎样写清审核规则,Anthropic 适合对照少误改和保留未知的能力;机构自己的合同审核规则册可能是下一轮最值得只改变的一个条件。
同一条件重复运行是否稳定、Microsoft Word 全面兼容情况、更多合同类型、真实机构规则册和真实合同中的表现。
MIT、Apache-2.0 通常较宽松,但仍须保留声明;Contract Copilot 使用 CC BY-NC 4.0,不能未经授权打包进商业产品;使用 FSL、没有许可证文件、许可证状态不明确,或只在项目介绍中自称 MIT 的项目,都应先固定到同一个代码版本再核验。学习评测不因此排除项目。
数据采集日:2026-09-03;实际运行证据截止:2026-09-05。完整 26 项候选清单、测试条件记录、18 次核心比较的原始输出、专家卡和文件校验值进入会员完整测试包。
公开报告帮助读者看懂这次评测;轻量测试包帮助跑完一次;年度会员完整包帮助把经验变成可运行、可复测、可迁移的资产。
一份虚构脱敏合同、统一任务、30 分钟操作说明、公开答案、100 分评分和四档使用决定。先验证“这个 Skill 对我有没有帮助”。
三份合同、6 种配置 × 3 份合同的 18 次对比、失败样例、专家标准、原始输出、Word 修订稿、基础组—Skill 对照模板、机构审核规则册和人工复核模板,支持查明效果来自哪里并迁移到自己的工作。
| 资产 | 用户能够完成的动作 |
|---|---|
| No.02 PDF、离线 HTML、26 项候选池 | 理解结论并继续核验项目版本、安装与复用边界。 |
| 三份合同、任务卡与公开评价卡 | 从一次测试扩展到三种不同法律结构。 |
| 18 次核心比较、失败样例与纠错过程 | 回到原始证据判断为什么通过或失败。 |
| 专家校准答案、关键风险和避免误改检查 | 区分漏掉问题、把正常条款误判为风险、站错委托立场,以及报告意见没有写进合同。 |
| 测试条件记录表、运行记录、基础组—Skill 对照模板和机构审核规则册模板 | 保持每轮只有一个条件发生变化,把测试方法迁移到自己的 Agent。 |
| 30 天实践路径与持续更新 | 把一次试用变成组织内可复跑的判断资产。 |
不是一堆很快过时的项目名称,而是持续更新的判断能力:看到新 Skill,知道值不值得试;拿到测试包,知道怎么测;测完以后,知道怎样配置、怎样复跑、哪里必须由人负责。
公开报告帮助你看懂;轻量包帮助你独立完成一次;会员完整包帮助你复跑、迁移并沉淀自己的合同审核规则册。
添加 CC 助理栗子
轻量包可在本页直接下载;也可添加助理,按指引加入交流群。

星月计划年度会员
扫码进入当前购买页,获取完整测试包。
前往微信小店了解与购买 →
订单、支付、退款及售后规则以微信小店购买页面为准。
如果只想了解这次评测,公开报告和轻量包已经足够;如果希望把经验做成可运行、可复测的能力,再进入会员完整包。
权益、价格和开通方式以购买页面显示为准。开始测试时只使用公开材料或虚构脱敏合同;不要在群聊或未经核验的服务中发送真实合同。