LegalTech CC LegalTech CC让 AI 进入法律工作的秩序
法律 AI 监测与实测 · No.02

开源合同审核 Skill 的真实帮助、稳定性与选型边界

找到 26 个公开候选,实际安装或运行 9 个,留下 34 次过程记录。

研究对象
合同审核 Skill 与同类公开项目
测试期间
2026 年 9 月 3 日—5 日
报告版本
R5.1 · 官网阅读版
ABOUT THIS REPORT

从“找到 Skill”,到知道它能不能进入工作

Agent 是能读取文件并按步骤完成任务的 AI 工作环境;Skill 可以先理解为“给这个 AI 加上的合同审核说明书和工作步骤”。真正要判断的不是它会不会说“能审合同”,而是:加上以后是否比不加载 Skill 的基础组更好,优势能否在不同合同上重复出现,发现的问题是否真的写进 Word 合同。

本报告沿用 No.01 的三份虚构脱敏测试合同和法律评价逻辑。区别在于,本期从评测原生 Agent 转向评测公开可获得的合同审核 Skill。报告解释结论;轻量包让读者自己跑一次;会员完整包提供三份合同、6 种配置 × 3 份合同的 18 次对比、原始输出和进阶复测材料。

本期替读者完成的六项工作

全球候选筛选从 GitHub、主流 Agent/Skill 生态与中英文公开项目中,筛出真正能识别合同风险、分析条款或直接修改合同的 26 个候选。
版本与许可核验记录项目入口、更新时间、GitHub 关注数与派生数、许可证和安装方式;许可证不作为学习门槛,但单列商业使用边界。
连续任务实测沿用 No.01 三份合同,用 6 种配置各审 3 份合同,共完成 18 次核心比较。
法律专家判定从委托方、事实、风险与适用法律地区、合同修改是否完整、谁来接手五个角度,判断能否进入真实流程。
配置与选型根据失败位置,判断该补审核说明书、机构规则册、法律检索工具、Agent 工作环境还是人工批准。
复跑材料提供 30 分钟轻量测试;会员包再提供三份合同、原始证据、基础组—Skill 对照模板和持续复测材料。
26
个公开候选项目
9
个实际安装或运行
34
次安装、运行或受阻记录
18
次同条件核心比较

为什么 9 个项目会有 34 条记录?

9 数的是实际动手验证的项目;34 数的是每一次安装、运行或受阻过程。同一个项目可能测试不同合同、不同配置,或进行一次纠正性运行,因此会留下多条记录。18 是其中最核心、条件最一致的一组比较:6 种配置各审 3 份合同。

边界:本期结果来自特定版本、固定任务和单次正式运行,不构成永久排名、采购背书或具体法律意见。静态数据截止 2026-09-03;动态证据截止 2026-09-05。

EXECUTIVE SUMMARY

执行摘要

01

全球候选已经形成生态,成熟的中国合同审核规则册仍然稀缺

26 个候选中,6 个主要面向中文合同,7 个是国际或通用 Skill,13 个是多步骤完整系统。能输出中文,不等于已经理解一家机构在具体合同上的业务目标、底线和退让规则。

02

“发现问题”和“把问题改好”是两种能力

18 次核心比较中,Anthropic 发现的风险最多,为 58/59;基础组与 Anthropic 真正写进合同且没有被其他条款抵销的问题最多,并列 43/59。但 6 种配置都只让 3 份合同中的 1 份达到人工谈判准备最低线。

03

Skill 确实能在特定问题上提供帮助,但换合同后不一定稳定

Contract Copilot 在猎头合同中把保证、免责和退款条款改成了一套不冲突的机制;code-lawyer 帮助多发现了一些问题;Anthropic 更少误改。三者提供的是不同能力,不适合压成一张总榜。

04

基础组只是一把对照尺,不是“不用 Skill”的建议

基础组使用同一个 Agent 和模型,但不加载审核 Skill。它帮助判断进步究竟来自 Skill,还是来自 Agent 本身。Skill 的价值也可能表现为少误改、修改更聚焦、发现真正写进合同,而不是总分必然上升。

05

当前没有可以不经人工复核直接使用的冠军

交付格式、审核规则、少误改能力、机构合同规则册、全文一致性、Word 质量检查和人工签发需要组合。先用一份合同判断是否有帮助,再决定是否投入三份合同的完整对照测试。

本期一句话结论

开源合同审核 Skill 已经能在特定法律问题上提供可观察的帮助,但尚没有一个项目能在三类合同上稳定解决全部关键风险;真正值得投入的不是“冠军名称”,而是一套能重复测试、能找到责任人的组合方法。

CONTENTS

报告结构

本期证据材料

候选项目清单、明确版本说明、安装与运行记录、三份连续性合同、6 种配置 × 3 份合同的保存结果、Word 修订稿、专家校准答案、法律评价卡、避免误改检查和纠错过程。正文只展示足以改变使用判断的证据,完整记录进入会员包。

核心术语

术语本报告中的含义
审核 Skill给 AI 加上的合同审核说明书和工作步骤,包括看什么、怎样判断、怎样修改和怎样交付。
机构审核规则册一家机构针对某类合同形成的立场、业务参数、条款底线、退让路线、全文关系和审批规则;技术圈常称为 playbook。
基础组使用同一个 Agent、同一模型、同一合同和同一任务,但不加载被测 Skill。它只是判断 Skill 是否有效的对照组。
真正写进合同问题不只出现在报告里,还变成可执行条款,并且没有被其他条款重新抵销。
放行最低线只要关键风险、事实边界、合同修改或人工责任有一项没过,就不能进入谈判准备;平均分再高也不能补回来。
PART 1 · RESEARCH DESIGN

研究设计:从公开候选到可复核证据

本期不把项目介绍中写着“能审合同”当作能力证据。候选先经过定向筛选,再判断是否只看公开材料、实际安装运行,或记录无法继续的原因。

1. 定向检索GitHub、主流 Skill 生态、中英文项目
2. 核心筛选必须能识别风险、分析条款或直接修改合同
3. 固定版本记录网址、更新时间、许可、安装和代码版本
4. 测试前定稿合同、任务、工具和运行条件不再改变
5. 保存输出报告、批注、Word、回执与阻断状态
6. 法律评分专家答案、关键风险、避免误改和人工动作

样本口径

进入核心池

项目公开可获得,而且确实提供合同风险识别、条款分析、合同修改或审核步骤。限制性许可和没有明确许可的项目可以用于学习观察,但需要醒目标记。

不进入核心池

纯闭源 SaaS、纯聊天模板、普通法律 RAG、仅合同生成器和只有通用 Agent 声明而没有合同审查入口的项目。

三类项目

第一类是中文或本土合同 Skill;第二类是国际或通用合同 Skill;第三类是包含读取、分析、修改和导出等多个步骤的完整系统。

过程记录

9 个项目共留下 34 次安装、运行或受阻记录,其中 28 次产生了合同审核结果,6 次在下载项目或调用外部模型前停止。同一项目可能因不同合同、配置或纠正性运行留下多条记录。

三份连续性合同

任务代表立场与业务目标主要考察
P1-001
市场推广
弱势甲方;新品按指定时间和渠道发布。业务日历、正文—附件联动、窗口前救济。
P1-002
猎头采购
服务购买方;费用与实际服务价值匹配。有效推荐—入职—付款—保证—替换—退款链。
P1-003
运营外包
服务购买方乙方;谈判地位均衡。直接管理、人员成本、退出迁移、数据和责任链。

本次结果不能说明什么

每种精确条件只正式运行了一次,因此还不能判断多次运行是否稳定;专家校准答案只适用于本次三份合同;LibreOffice 兼容检查不能替代 Microsoft Word 的全面检查;真实客户合同、其他国家或地区法律和真实机构审核规则册的表现仍然未知。

PART 2 · LEGAL EVALUATION

合同审核 Skill 的价值不在“说了多少”,而在是否把委托目标、事实、风险、条款和责任连接成一条可以复核的法律交付链。

委托 / 角色代表谁,核心交易目标是什么,是否角色反转
事实 / 未知合同、任务、附件与假设是否区分
风险 / 适用法律风险如何发生,依据是否真实适用
条款定位是否回到具体条款、附件或缺失材料
修改是否完整是否写入可执行方案,全文是否一致
人工接管谁补事实、定参数、批例外、发送签署

发现不等于解决:关键风险必须走完六步

步骤最低要求常见伪通过
1. 立场保护正确的委托方和交易目标。为了“公平”反向削弱委托方。
2. 定位指向真实条款、附件或缺失材料。只给通用风险标题。
3. 论证解释风险发生机制和后果。堆法条或结论。
4. 处理写入修订、删除、新增或阻断动作。只在报告里“建议修改”。
5. 全文相邻条款、定义、附件和例外不抵销。主条款改了,另一条又放开。
6. 交接未知、参数和剩余风险交给明确责任人。笼统写“请人工复核”。

报告中的三种分数

指标回答什么不能说明什么
发现风险 /5929 个加权问题中看到了多少。不说明是否真的改进合同。
真正写进合同 /59多少问题变成有效条款,而且没有被其他条款抵销。不能掩盖关键风险仍未解决。
是否达到放行最低线这次输出能否进入人工主导的谈判准备。不是对产品的永久评级。

出现以下任一问题,就不能放行

站错委托立场、虚构决定性事实或法源、漏掉事先确定的关键风险、报告意见没有写进最终合同、违反数据边界。平均分再高也不能补回来。

PART 3 · OVERALL RESULTS

总体结果:没有可以直接使用的冠军,但 Skill 并非没有帮助

下表使用 29 个加权问题、59 总权重。百分比只描述本次三份虚构脱敏测试合同,不是现实世界准确率。

测试配置发现风险 /59真正写进合同 /59解决关键风险 /5达到最低线的合同避免误改*
基础组(不加载 Skill)52(88.1%)43(72.9%)31/390.9%
Contract Copilot51(86.4%)21(35.6%)21/386.4%
code-lawyer55(93.2%)41(69.5%)31/390.9%
pa1nrui153(89.8%)40(67.8%)21/395.5%
contract-review-pro53(89.8%)40(67.8%)31/3100%
Anthropic review-contract58(98.3%)43(72.9%)21/3100%

* “避免误改”检查的是 11 个本来不应该删除、扩大或绝对化处理的地方,不代表现实使用中不会误判或乱改。

把结果拆开,才能看到 Skill 的三种帮助

帮助多发现问题

code-lawyer 达到 55/59,说明写清审核规则和步骤,可以帮助 Agent 多看到一些问题;但新增发现没有全部写进合同。

帮助解决特定法律难题

Contract Copilot 是 P1-002 唯一达到放行最低线的方案,说明 Skill 能改变单份合同的使用结论。

减少误判和乱改

Anthropic 发现 58/59,11 项“避免误改”检查全部通过,适合作为通用对照,但不能替代中国合同的机构审核规则册。

为什么“不加载 Skill 的基础组”看起来很强

基础组使用同一个 Agent 工作环境、同一模型、同一合同和同一任务,唯一差别是不加载被测 Skill。基础组本身已经发现大部分问题时,总发现数很难继续拉开差异;此时更要看 Skill 是否减少遗漏、减少乱改、让修改更聚焦,并把报告意见真正写进合同。基础组只是一把对照尺,不是最终推荐。

多步骤完整系统:目前无法得出高低结论

Counsel OS 没有取得可固定的公开代码版本;lowtide 完成前置处理后,需要外部模型才能继续;ContractAuditAgent 的离线规则可以运行,但没有命中本次专家答案中的问题。因此,本次无法证明“完整系统比单个 Skill 更好”。不能把没完成测试记成法律能力 0 分,也不能把项目介绍当成真实审核结果。

CASE 01 · MARKET LAUNCH

案例一:市场推广——所有方案共同漏掉业务日历

唯一不可失守的目标是:新品必须在指定时间、指定渠道统一发布。一般免责、违约金和风险数量都不能替代窗口前保护。

C1 统一解禁正文与附件发布时间必须一致。
C2 媒体锁位核心资源应提前锁定并可验证。
C3 顺延边界反馈迟延只影响对应单项。
C4 替代资源降档和失败须及时触发替代。
C5 假期排期国庆假期会压缩真实准备窗口。
市场推广合同 Word 连续性证据
图 1|与 No.01 使用同一份合同。图中是市场推广合同的 Word 条款片段。本期根据已经保存的 Skill 输出重新评分,图片帮助读者看到“定义—发布时间—顺延—补救措施”之间的关系。

18 次核心比较实际说明了什么

六组均未完整关闭正文—附件的统一解禁链,也共同漏掉国庆假期压缩。部分方案发现媒体替代、资源降档和救济,却没有形成“真实业务日历—提前锁位—窗口前替代”的完整保护。

放行结论:六组都没有达到最低线

业务应确认上市日、解禁时刻、核心媒体与假期排期;法务把正文、附件、替代资源和窗口前补救措施联动。这个共同缺口首先需要市场推广合同的机构审核规则册,而不是再叠加一张通用风险清单。

对 Skill 选型的启示

通用合同审核 Skill 往往擅长责任、付款、知识产权和合规,却不知道这笔交易唯一不可失守的是业务日历。机构审核规则册的价值,是把“什么时候失败、什么时候补救已经太晚”写成前置检查和条款关系。

CASE 02 · RECRUITMENT SERVICES

案例二:猎头采购——Skill 的帮助可以改变签约结果

这份合同的难点不是发现费率不利,而是让有效推荐、实际入职、阶段付款、保证期、主动离职、免责、替换和退款成为一套一致机制。

C1 付款触发Offer、入职和服务价值的关系。
C2 费用圈地有效推荐、关联方和保护期。
C3 保证冲突第 7.2 与 7.6 的责任逻辑。
C4 唯一救济替换失败后是否现金退款。
C5 人工参数费率、期限、比例与授权。
猎头合同 Word 连续性证据
图 2|No.01 连续性证据。同一猎头合同中的保证与退款条款片段。本期关键不是“提到退款”,而是第 7.2、7.6、7.7 条之间能否形成一致的保证—免责—退款机制。

本轮最明确的法律帮助

6 种配置都发现了全部加权问题,只有 Contract Copilot 把保证范围、排除原因、优先关系和举证责任改成一套不冲突的机制。它成为唯一让这份合同达到人工谈判准备最低线的配置。与不加载 Skill 的基础组相比,它在 P1-002 的原始法律分上增加 5.5 分;把关键风险是否解决考虑进去后,最终法律分增加 18.5 分。

放行结论:Contract Copilot 达到最低线,其他五组没有达到

这证明 Skill 可以产生足以改变签约判断的专项帮助。它仍不能替 HR、采购、财务和法务决定费率、保证期、退款比例、关联方范围和合同终止后的遗留责任。

适用边界:一次合同上的成功不能外推为跨合同冠军。Contract Copilot 在三份合同中的原始法律分均值为 59.7,基础组为 62.3;两者都只让 3 份合同中的 1 份达到放行最低线。

CASE 03 · OUTSOURCED OPERATIONS

案例三:运营外包——同一个 Copilot 为什么前后反转

第一次结果与后来一次纠正性运行看似矛盾,实际上说明:“Skill 里的审核方法有没有价值”和“它能不能稳定写进最终合同”必须分开判断。

C1 直接管理谁排班、考勤、绩效和奖惩。
C2 人员成本退出、减员和待岗成本是否转嫁。
C3 行为隔离工牌、邮箱、组织和社保边界。
C4 退出迁移无因退出与高价过渡的组合。
C5 数据模型去标识化、训练与迁移责任。
运营外包合同 Word 连续性证据
图 3|No.01 连续性证据。同一运营外包合同的 Word 片段。本期重点复核第 2.3、2.4、12.1—12.3、16.2 与 16.4 是否一起关闭人员管理和退出成本链。

第一次运行

报告列出 20 个问题,但最终 Word 只有少量修订痕迹,多数意见停留在报告或批注,“真正写进合同”得分为 0/24。这说明从报告到合同修改的环节失败,不等于它完全不会发现法律问题。

纠正性运行

固定到同一个代码版本,再用最少的连接步骤运行一次,完成了 42 组条款写入,实现 24/24 发现、22/24 写进合同,与基础组持平;对人员退出成本和不可抗力的处理也更合理。

采用结论:审核方法和执行稳定性必须分别检查

采用前核对“报告发现—修改计划—批注—最终条款”是否一致;还要事先写清测试条件,再用同一份合同重复测试。一次失败不能否定 Skill,一次成功也不能证明它稳定。

PART 4 · SKILL PROFILES

能力剖面:最值得同场比较的三种方向

以下判断只针对本期固定版本与三份合同,用于任务匹配,不构成长期排名。

Contract
Copilot
本期最值得吸收

从审核、修改到意见书的交付结构;在猎头合同中解决了保证、免责和退款条款互相冲突的问题。

采用前必须验证

换合同后是否仍然稳定、报告意见是否都写进合同、Word 是否兼容、是否加入机构审核规则册;CC BY-NC 限制商业复用。

code-lawyer
本期最值得吸收

中国规则来源、审核计划和可追溯的合同修订;发现风险提高到 55/59,适合研究怎样把审核规则写清楚。

采用前必须验证

多发现的问题没有自动变成全文一致的合同修改,需要继续检查正文与附件是否冲突。

Anthropic
本期最值得吸收

会保留信息不足之处,通用风险发现较多,也较少误改;发现 58/59、真正写进合同 43/59,11 项避免误改检查全部通过。

采用前必须验证

对中国合同关键风险、中文条款表达和机构参数覆盖不足;适合作通用对照,不能替代本地审核规则册。

其他中文
候选
值得继续观察

contract-review-pro 的 11 项避免误改检查全部通过;pa1nrui1 在部分中文合同上表现较好;Rohas 对委托方和条款位置写得清楚。

当前边界

许可证不清、换合同后波动、报告意见没有稳定写进合同,或修改后仍有条款冲突,都需要继续验证。

全球候选池数据大盘

中文 Skill
6
国际 Skill
7
完整系统
13

图 4|26 个核心候选的技术形态分布。完整系统数量最多,但工程链更长不等于法律推理更强。

25.5
GitHub 关注数中位数
96.4%
关注来自 Anthropic 两个大型仓库

GitHub 关注数合计 34,404,派生数合计 4,903。12 个项目在 30 天内更新,18 个在 90 天内更新;其中 21 个项目可以取得精确更新时间。

许可证与别人能否按说明复跑

维度本期分布怎样解释
许可证MIT 13;Apache-2.0 5;CC BY-NC 1;FSL 1;未知 6不影响学习比较,影响修改、再分发和商业使用。
别人能否按说明复跑A 级 7 个;B 级 14 个;C 级 5 个A 表示入口较完整,C 表示缺少关键步骤;都不等于法律能力已经验证。
先研究谁关注度、近期更新、与合同审核的相关程度、复跑难度只用于安排研究顺序;直播展示效果不进入研究评分。

采集日:2026-09-03。许可证按固定仓库可见文件记录;README 自称 MIT、无 LICENSE 与 NOASSERTION 均保留为待核验状态。

PART 5 · SELECTION FRAMEWORK

测完以后,应该补审核说明书、机构规则册、检索工具,还是人工批准

“Skill 没有帮助”或“基础组更强”都不是足够精确的结论。先找到问题发生在哪一步,再在下一轮只改变一个条件。

同一类关键风险反复漏掉
补充审核 Skill 或该类合同的风险清单
保持 Agent 工作环境、模型和合同不变,只更换一个 Skill。
能发现,但修改后仍与相邻条款冲突
补机构审核规则册和全文一致性检查
把业务目标、条款底线、退让线和附件关系写进流程。
法源过时、无法核验
增加经过核验的法律检索工具
检索结果必须对应具体问题,不能只展示调用次数。
文件、批注、Word 修订不稳定
更换 Agent 或原生 Word 工作流
法律任务保持不变,只换交付路径。
商业参数、例外、发送和签署不清
设置人工批准环节
AI 提供选项,获授权人员承担最终决定。

本期三项目的差异化 Demo

Contract CopilotP1-002:保证—免责—退款机制链。
code-lawyerP1-001:发布窗口与正文—附件联动。
AnthropicP1-003:未知事实和避免误改。

当前更有依据的组合方向

用 Contract Copilot 研究怎样交付报告和合同修改,借鉴 code-lawyer 的审核规则和可追溯修订,吸收 Anthropic 少误改、会保留未知事实的优点,再加入机构自己的中国合同审核规则册、全文一致性检查、Word 质量检查和人工签发。这个组合尚未实现或验证。

根据结果决定使用层级

不可用于任务(R0)

数据红线失败、输出无法检查或总分低于 50。只能排查安装和配置。

仅作风险线索(R1)

50—69 分,或关键红线没有通过。由律师重新分析。

可作专业底稿(R2)

70—84 分且红线通过。必须逐项人工复核。

可进入受控试用(R3)

85—100 分、红线通过、Word 稳定,并在多份同类合同上重复通过。

PART 6 · 30-MINUTE RE-RUN

拿起轻量测试包:30 分钟得到自己的使用决定

第一次只测试 P1-003 客户运营支持外包合同。它能同时观察直接管理、人员成本、退出迁移、数据和责任链,也最容易暴露“报告有、合同没改”。

运行前:填写“测试条件记录表”

配置项记录内容
使用哪个 AI 工作环境记录具体产品入口和可见版本。
使用哪个模型记录模型名称、日期和可见版本。
使用哪个 Skill记录项目网址,并固定到同一个代码版本。
外部工具、网络和历史记忆默认关闭;如果开启,要明确记录。
Word 能力能否读取原始 DOCX 并输出原生修订与批注。
人工干预是否补充法律思路、修复工具或提供答案。

只给 Agent 两个文件

01|任务说明

代表购买服务的乙方,要求在原始 Word 合同上完成修订,另列事实假设、待确认项和需要谁接手。

02|虚构脱敏测试合同

不要提供评分卡、研究报告、其他项目输出或隐藏风险清单;只运行一次,不自动重试。

先保存完整结果,再按 100 分和五项红线评分

维度权重满分信号
该发现的问题发现了多少20对照公开 10 项答案逐项定位。
有没有误判或乱改10不站错委托立场,不机械删除,不把条件问题改成绝对规则。
条款定位10回到准确条款、附件或缺失材料。
理由与依据10解释发生机制,依据真实适用,未知保留。
修改建议是否能直接谈15给出可执行的替换文本,也说明可以退让到哪里。
合同前后是否一致15正文、定义、附件、例外、责任与退出没有互相冲突。
适用法律和事实是否说清5区分合同里写明的事实、任务补充、假设和未知。
Word 是否稳定5原始文件能打开、修订可以追踪、失败后可以恢复。
速度与安装530 分钟内完成,无临时补丁。
隐私与人工责任5数据路径透明,发送签署和参数留给人。

五项红线

是否站对委托方、是否虚构决定性事实或法源、两个关键风险是否真正解决、报告意见是否写进合同、是否违反数据边界。数据边界失败直接判为“不可用于任务”;其他红线失败最多只能“作为风险线索”。一份合同即使高分,也不能直接投入使用,还要再用至少两份同类合同验证,并在版本更新后复测。

SOURCES & BOUNDARIES

证据、许可证与主要入口

已核验事实

26 个候选有公开合同审核入口;9 个项目被实际安装、运行或记录受阻原因;共留下 34 次过程记录;6 种核心配置都只让 3 份合同中的 1 份达到人工谈判准备最低线;完整系统组没有形成可公平比较的审核结果。

研究推断

Contract Copilot 值得研究交付格式,code-lawyer 适合研究怎样写清审核规则,Anthropic 适合对照少误改和保留未知的能力;机构自己的合同审核规则册可能是下一轮最值得只改变的一个条件。

仍然未知

同一条件重复运行是否稳定、Microsoft Word 全面兼容情况、更多合同类型、真实机构规则册和真实合同中的表现。

许可证是复用边界,不是能力分

MIT、Apache-2.0 通常较宽松,但仍须保留声明;Contract Copilot 使用 CC BY-NC 4.0,不能未经授权打包进商业产品;使用 FSL、没有许可证文件、许可证状态不明确,或只在项目介绍中自称 MIT 的项目,都应先固定到同一个代码版本再核验。学习评测不因此排除项目。

主要一手来源

数据采集日:2026-09-03;实际运行证据截止:2026-09-05。完整 26 项候选清单、测试条件记录、18 次核心比较的原始输出、专家卡和文件校验值进入会员完整测试包。

PROGRAM VALUE

持续监测的价值:让每次工具变化都不再从零开始

公开报告帮助读者看懂这次评测;轻量测试包帮助跑完一次;年度会员完整包帮助把经验变成可运行、可复测、可迁移的资产。

轻量包解决第一次判断

一份虚构脱敏合同、统一任务、30 分钟操作说明、公开答案、100 分评分和四档使用决定。先验证“这个 Skill 对我有没有帮助”。

会员包承接完整复测

三份合同、6 种配置 × 3 份合同的 18 次对比、失败样例、专家标准、原始输出、Word 修订稿、基础组—Skill 对照模板、机构审核规则册和人工复核模板,支持查明效果来自哪里并迁移到自己的工作。

本期会员完整测试包

资产用户能够完成的动作
No.02 PDF、离线 HTML、26 项候选池理解结论并继续核验项目版本、安装与复用边界。
三份合同、任务卡与公开评价卡从一次测试扩展到三种不同法律结构。
18 次核心比较、失败样例与纠错过程回到原始证据判断为什么通过或失败。
专家校准答案、关键风险和避免误改检查区分漏掉问题、把正常条款误判为风险、站错委托立场,以及报告意见没有写进合同。
测试条件记录表、运行记录、基础组—Skill 对照模板和机构审核规则册模板保持每轮只有一个条件发生变化,把测试方法迁移到自己的 Agent。
30 天实践路径与持续更新把一次试用变成组织内可复跑的判断资产。

年度会员最终留下什么

不是一堆很快过时的项目名称,而是持续更新的判断能力:看到新 Skill,知道值不值得试;拿到测试包,知道怎么测;测完以后,知道怎样配置、怎样复跑、哪里必须由人负责。

JOIN THE PROGRAM

先免费跑一次,再决定是否进入完整复测

公开报告帮助你看懂;轻量包帮助你独立完成一次;会员完整包帮助你复跑、迁移并沉淀自己的合同审核规则册。

免费|轻量测试包

添加 CC 助理栗子
轻量包可在本页直接下载;也可添加助理,按指引加入交流群。

  • 1 份虚构脱敏合同
  • 统一任务与 30 分钟说明
  • 答案卡、100 分评分和四档使用决定

会员|完整测试包

星月计划会员购买二维码

星月计划年度会员
扫码进入当前购买页,获取完整测试包。
前往微信小店了解与购买 →
订单、支付、退款及售后规则以微信小店购买页面为准。

  • 三份合同和 18 次核心比较
  • 专家标准、原始输出和 Word 修订稿
  • 对照模板、机构审核规则册、30 天实践和持续更新

如果只想了解这次评测,公开报告和轻量包已经足够;如果希望把经验做成可运行、可复测的能力,再进入会员完整包。

权益、价格和开通方式以购买页面显示为准。开始测试时只使用公开材料或虚构脱敏合同;不要在群聊或未经核验的服务中发送真实合同。