LegalTech CC LegalTech CC让 AI 进入法律工作的秩序
法律 AI 监测与实测 · No.01

合同审核 Agent 的可执行性、法律交付能力与选型边界

6 款 Agent × 3 类合同 × 18 次端到端运行。真正要判断的,不是谁最会写,而是谁离“可承担责任的法律交付”更近。

研究对象
WorkBuddy、Claude、Codex、豆包、通义千问、DeepSeek
测试期间
2026 年 9 月 1 日—2 日
报告版本
V3.0 · 官网阅读版
研究边界
特定版本、权限与单次正式运行;不构成采购背书或法律意见
10 分钟读执行摘要与总体结论
30 分钟用猎头合同完成首次复测
R0—R3判断工具可用层级与人工接管点
ABOUT THIS REPORT

从产品变化,到可验证的使用决定

法律 AI 的更新越来越快,但真正稀缺的并不是“知道哪个产品又更新了”,而是能够在真实法律任务中验证:它是否适合自己的工作、需要怎样配置、能安全使用到哪一步、哪里必须由人接管。

本报告属于“星月计划·法律 AI 监测与实测”系列研究成果。它同时承担三项任务:解释本期评测如何完成;用实际合同证据说明不同 Agent 的能力边界;提供一套可直接复跑的测试方法,帮助读者在自己的工作环境中重新验证。

年度会员每期得到的,不是一条新闻,而是一套验证单元

变化筛选从模型、Agent、MCP、Skill 和工作流更新中,筛出真正可能影响法律任务与交付方式的变化。
真实任务与样本提供已经定义好代表立场、业务目标、输入材料和交付要求的脱敏法律任务,减少从零设计测试的成本。
统一测试方法冻结材料、权限、工具和输出,避免因为随手提问、答案污染或不同底稿而得出失真的结论。
法律专家判定进入实际 Word,判断立场、事实、critical issue、依据、修订方案和人工责任是否形成完整链条。
配置与使用建议根据失败位置判断应当更换 Agent、接入 MCP、增加 Skill、进入工作台,还是设置人工 Gate。
版本回归模型、工具或方法更新以后,使用同一测试包复跑,验证能力是否真的改善,而不是凭产品宣传作判断。
6
款 Agent 的原生工作流
3
类不同法律结构的合同
18
次端到端独立运行

读者可以怎样使用本报告

10 分钟:阅读执行摘要与总体结果,理解本期结论。30 分钟:使用猎头服务采购任务完成第一次复测。进一步部署:使用三份合同的专属 critical 卡,对自己的 Agent、MCP 和 Skill 做回归验证。

研究边界:本期结果来自特定时间、版本、权限和一次正式运行,不构成任何产品的永久能力排名、采购背书或法律意见。不同平台的 Token、积分与金额口径不一致,不用于法律质量比较。

EXECUTIVE SUMMARY

执行摘要

01

端到端“跑完”与法律上“可交付”是两种判断

直播百分制能够观察 Agent 是否理解任务、使用工具、修订 Word 并保留过程证据,但法律交付不能只看总分。只要站错立场、混淆事实、漏掉关键风险,或者修订没有真正进入合同,其他维度的得分不能将其平均掉。

02

原生 Word 能力正在成熟,critical 闸门却仍然不可省略

多款 Agent 已能在原合同上保留编号、格式、修订和批注,这说明办公执行已经进入可用阶段。但 P1-003 中,Claude 对第 2.3 条和新增第 12.4 条的处理非常专业,却遗漏了相邻第 2.4 条的人员退出成本转嫁,仍需判定为必须补审。

03

风险数量、检索次数和文档长度都不是法律价值的替代指标

在市场推广合同中,Codex 识别的预设风险数量最多,但最终质量并未按照风险数量排序;三题 MCP 调用总量最高的也是 Codex。检索只有进入具体 issue,改变风险判断、条款或谈判策略,才形成法律价值。

04

不同工具解决的是不同瓶颈,不能用同一种方式补救所有失败

无法稳定读取和修订 Word,首先是 Agent 或原生工作流问题;法源过时或无法核验,需要 MCP;Word 很完整但反复漏掉同类 critical,说明缺的是 Skill、issue map 和验收标准;跨对话的事项、版本与审批分散,则需要工作台。

05

年度监测的长期价值,是持续形成自己的测试资产

单期报告帮助用户完成一次判断;持续监测会逐步沉淀合同、检索、合规和案件任务的测试库,形成选型标准、验证过的 Skill、人工复核 Gate 与版本回归记录,使法律人面对新工具时不再从零开始。

本期一句话结论

本轮真正测出的不是“谁最会写”,而是六种方案距离可承担责任的法律交付还有多远,以及法律人应当怎样把 Agent、MCP、Skill、工作台与人工判断重新组合。

CONTENTS

报告结构

01研究设计:本期到底在测什么
02法律专家框架:从执行分到交付闸门
03总体结果:为什么不能直接做排行榜
04案例一:新品发布保护链
05案例二:猎头费用与保证闭环
06案例三:外包合同的 critical 遗漏
07工具选择:Agent、MCP、Skill 与工作台
08复跑指南:30 分钟完成第一次测试

本期基础材料

本报告基于三类脱敏合同、六款 Agent 的 18 份正式修订 Word、assumptions 与运行记录、直播评分底稿,以及法律专家复核框架形成。正文保留能够解释方法和选择的核心证据,未将全部修订、运行日志和密封答案逐页展开。

核心术语

术语本报告中的含义
Agent能够读取文件、调用工具、连续执行并形成交付物的原生工作环境,而非单次聊天回答。
MCP向 Agent 提供外部法律数据库或其他工具能力的连接接口。本期主要观察法律查询工具的实际调用与可用性。
Skill把任务步骤、判断方法、关键问题和验收标准固化为可复用能力,用于提高同类任务的一致性。
critical issue一旦遗漏,就可能导致核心交易目标落空、重大法律责任继续敞口或结果无法进入真实流程的问题。
法律交付闸门在总分之外,对立场、事实、critical、方案和人工责任进行阻断式检查,用来决定结果是否能进入谈判或签发。
PART 1 · RESEARCH DESIGN

研究设计:本期到底在测什么

本期没有测试“模型是否会谈论合同风险”,而是测试从原始合同到可审阅 Word 的完整工作链。被比较的对象不是裸模型,而是原生模型 + 原生 harness + 可用工具与资料权限 + 交付工作流。

1. 定义真实任务明确代表立场、交易目标和谈判地位
2. 冻结输入同一原始 DOCX、任务卡和安全边界
3. 统一权限只读合同库、法律 MCP 与 Word 要求
4. 独立运行Agent 自主读取、检索、判断和修订
5. 保存证据修订 Word、批注、assumptions、日志
6. 法律复核按专属 critical 与人工责任判断

三类合同分别测试三种法律工作

任务代表立场与业务目标为什么选择这一类合同
P1-001
市场推广
弱势甲方;新品必须按指定时间、指定渠道发布。测试 Agent 能否围绕一个不可失守的业务目标,识别正文与附件冲突,并在首发窗口关闭前建立预警、替代和救济。
P1-002
猎头采购
服务购买方;预算有限,费用必须与实际服务价值匹配。测试 Agent 能否把有效推荐、入职、付款、保证期、替换与退款组织成一条完整收费机制,而非只评价“条款不利”。
P1-003
客户运营外包
服务购买方乙方;谈判地位均衡。测试 Agent 能否同时处理直接管理、事实用工、劳务派遣、按人头计价、人员退出成本与数据等结构性问题。

统一测试条件

固定输入

每个任务使用同一原始 DOCX、同一任务说明和相同的文件边界。测试中不向 Agent 提供 checklist、标准答案或其他产品输出,避免把独立风险识别变成答案复述。

固定交付

最终必须在原合同上使用 Word 原生修订和批注,另存修订 DOCX,并输出 assumptions。不得另写一份新合同,也不得把 Markdown 或 HTML 重新生成成 Word。

记录差异

记录模型与产品版本、工具调用、运行时间、失败与人工干预。不同平台的工具可用性与 Token 口径并不完全一致,因此资源数据只用于解释工作方式。

法律基线先冻结

每份合同在查看 Agent 输出前建立专属 issue map,并将风险分为 critical、major 与 standard。这样可以防止看完结果后,为喜欢的输出倒推评分标准。

证据限制

每款 Agent 每题只保留一次正式运行,本报告不能证明跨版本稳定性;本期没有完整双评分者一致性数据,不能把相差数分解释为确定能力差距;第三题包含连续上下文因素,三题之间不宜计算平均分。

PART 2 · LEGAL EVALUATION

合同审核不是文本生成,而是一条法律论证与决策链。能够发现风险只是起点;真正可用的结果还要把事实、依据、修改、谈判和责任连接起来。

委托识别代表谁、交易目标是什么、谈判地位如何
事实识别合同写了什么、附件是否齐全、哪些事实未知
风险识别哪些问题会影响履约、合规、经营或退出
依据与论证风险为何成立,依据来自合同、事实还是法律
策略转化必须改什么、如何改、可以怎样交换
责任闭环谁补事实、谁决定参数、谁批准和签发

第一层:端到端执行观察分

维度分值观察内容
A 任务理解20是否理解角色、目标、输入、输出和边界。
B 工具与资料20是否读取材料、使用合同库和法律检索,并避免无效调用。
C 风险识别25是否发现预设风险并形成合理优先级。
D Word 交付20是否在原始 DOCX 上形成可审阅修订、批注和完整格式。
E 可验证与可控15是否披露假设、未决事项、工具和失败,过程是否可追溯。

这一百分描述的是“Agent 完成整个任务包的质量剖面”。由于风险识别只占 25 分,工具与 Word 合计占 40 分,它不能单独回答律师能否签发。

第二层:法律交付闸门

状态判断标准允许用途
PASS
可进入人工主导的谈判准备
立场正确;关键事实边界清楚;全部 critical 有有效处理;方案可执行;人工节点明确。作为律师或法务谈判底稿,仍需复核和批准。
WARN
必须补审
存在 1 个 critical 未识别或未有效写入;关键事实未闭环;方案只有评价没有条款;法源或责任不完整。作为问题线索或初稿,先补审指定问题。
FAIL
不得进入业务流程
站错立场;虚构决定性事实或法源;漏掉 2 个以上 critical;未经授权接受重大风险;输出不可追溯。仅用于诊断工具问题,不得向业务发送。

什么时候才算真正覆盖一个风险

至少要同时完成四件事:定位具体条款或缺失材料;解释它如何影响委托方;处理为可执行的修订、删除、新增或阻断建议;交接不能由 AI 确认的事实、数字和风险偏好。只写“建议明确”“建议法务核验”,不算完整覆盖。

PART 3 · OVERALL RESULTS

总体结果:分数可以比较,结论不能简化成排行榜

下表沿用直播中的内部最终分。它反映每款 Agent 在特定任务中的执行完成度,但不宜跨题计算平均分,也不能绕过合同专属 critical 闸门。

AgentP1-001
市场推广
P1-002
猎头采购
P1-003
运营外包
本期最值得关注的信号
WorkBuddy889998谈判分层、待办组织与相邻风险闭环较充分。
Claude889984论证链完整,但 P1-003 出现“高质量局部 + critical 遗漏”。
Codex858189工具与广覆盖能力突出,需把投入压缩为优先级和证据链。
豆包929998原生 Word 执行成熟,仍需逐项 critical 验收。
通义千问858791修改相对克制,关键在于少改是否仍覆盖决定性风险。
DeepSeek679079会披露知识边界,但复杂风险覆盖与方案闭环不足。

风险发现数量与法律交付质量并不线性

P1-001 的预设风险命中数量如下。Codex 的命中最多,但总分没有同步成为第一;WorkBuddy 和 Claude 的命中数量不占优势,却能够在部分核心问题上形成更完整的发布保护链。

Codex
12 / 16
豆包
10 / 16
Claude
9 / 16
WorkBuddy
7 / 16
通义千问
7 / 16
DeepSeek
2 / 16

解释重点:命中风险只是“看到了”。法律专家还要判断是否站对立场、是否抓住核心目标、是否形成可执行修订、是否把事实与决定交回正确的人。

运行效率与 MCP 调用:用于解释工作方式,不用于加法律分

Agent三题运行时长法律 MCP 总调用使用解释
WorkBuddy约 22—35 分钟39工具调用与谈判工作底稿组织较均衡。
Claude约 23—28 分钟30检索较多进入具体论证与条款理由。
Codex约 21—44 分钟70调用最多,但法律价值取决于是否进入关键 issue。
豆包约 25—34 分钟21部分任务存在工具可用性波动,Word 执行仍较完整。
通义千问约 24—28 分钟26调用相对克制,需看是否支持关键结论。
DeepSeek约 9—14 分钟0本轮未形成同等法律 MCP 结果,不能据此认定不检索。
CASE 01 · MARKET LAUNCH

案例一:新品发布合同——风险必须在窗口关闭前被真正解决

这道题的难点不是发现一般免责条款,而是保护弱势甲方唯一不可失守的目标:智能手表新品必须在指定时间、指定渠道按约发布。

C1 解禁冲突“上市日±1日”允许提前发布,与统一解禁安排冲突。
C2 锁位过晚核心媒体到“上线日前”才说明失败,已来不及补救。
C3 顺延失控甲方反馈迟延可能导致整体首发顺延。
C4 救济过晚解除、违约金等事后救济不能挽回首发窗口。
C5 降档漏洞只有多项指标“均显著低于”才受限,单项降档可绕开。

最低合格的法律保护链

定义上市日与统一解禁时间;禁止提前发布;将“±1日”改为仅允许上市日或次日;提前逐一锁定媒体与版位;未锁定时同步提供同等级替代资源;甲方反馈只允许受影响单项顺延;在窗口关闭前设置催告、资源移交和替代履行。

证据说明
图 1|定义条款。Claude 新增上市日和解禁时间,并明确任何媒体、KOL 和产品信息不得早于解禁时间上线或披露。
证据说明
图 2|顺延边界。甲方反馈迟延仅允许受影响的单项交付等期顺延,核心媒体与附件首发节点不得延后。

法律专家怎样解释这份输出

Claude 的价值不在于“发现发布时间问题”,而在于把商业目标、合同证据、风险、事前控制和人工事实交接连接起来。实际 Word 中还出现了上市日前五个工作日锁定 8 家核心媒体、把资源降档标准中的“均”改为“任一项”、以及逾期未补救时允许甲方替代履行并要求移交资源和付款凭证等处理。

与此同时,真实解禁时刻、媒体与 KOL 锁定状态、节假日排期、预算、违约金和内容复用范围仍需业务与法务确认。专业输出应当显化这些未知,而不是替用户作决定。

六款 Agent 在本题分别揭示了什么

Agent本题观察进入谈判前的人工重点
Claude形成定义—锁位—顺延边界—替代履行的完整链条之一。确认真实解禁时间、版位事实、违约金和退让空间。
WorkBuddy建立刚性节点、替代履行,并将多项修改分成必争与可退让。Agent 建议的 10%、20%、30% 等比例必须由授权人批准。
豆包原生修订和批注完整,覆盖顺延、锁位、付款、合规与责任。逐字确认“均显著低于”是否真正改掉,不能只看批注数量。
Codex覆盖面广、MCP 调用多,风险数量最高。将大量修改压缩为核心交易目标,删除谈判成本过高的次要修订。
通义千问修改相对克制,包含锁位、提示和备选资源。确认解禁、附件窗口、降档漏洞与替代履行是否全部闭环。
DeepSeek能识别上市日重要性和部分责任问题,并披露知识边界。补足定义—锁位—替代—窗口前救济的完整机制。
CASE 02 · RECRUITMENT SERVICES

案例二:猎头服务合同——从“条款不利”到费用与服务价值闭环

猎头合同看起来比外包合同简单,却很容易在多个条款之间形成收费出口。真正的审核对象不是某一个费率,而是有效推荐、实际入职、付款、保证期、替换与退款之间是否一致。

C1 付款过早候选人接受 Offer 即产生 50% 服务费,未入职亦不退。
C2 费用圈地有效推荐门槛低、关联方宽、保护期长、终止尾巴长。
C3 保证冲突第 7.2 与 7.6 条对主动离职的责任逻辑直接冲突。
C4 唯一救济替换是唯一补救,替换失败后没有现金退款。
C5 核查免责候选人质量核查责任被压缩到极窄范围。

最低合格的收费与保证机制

有效推荐应限定职位、完整简历、候选人同意和购买方接收;首期付款应后移至实际入职,余款与保证期或在职状态关联;未入职不收费或退款;保证责任不得被“个人原因”普遍免责架空;购买方可以在替换和退款之间选择,替换限期届满后转为现金退款。

证据说明
图 3|付款触发点。实际 Word 将 Offer 阶段收费后移至候选人实际办理入职并开始提供劳动或服务,未实际入职不产生服务费。
证据说明
图 4|保证期与退款。修订统一第 7.2 条的保证责任逻辑,并允许购买方选择替换或按在职时间获得阶梯退款。

为什么“改了一处付款条款”还不够

如果只把第 4.1 条的首期付款从 Offer 后移到入职,但仍保留宽泛的有效推荐、关联方收费、12 个月保护期和终止长尾,费用仍可能从其他条款重新产生。同样,如果第 7.2 条写明主动离职触发保证,第 7.6 条又以“个人原因”普遍免责,保证机制仍会被架空。

因此,猎头合同的专业判断应当沿着一条连续链条验收:有效推荐 → 实际入职 → 阶段付款 → 保证期 → 离职触发 → 替换或退款 → 替换失败后的现金救济。

本题对工具选择的启示

观察对用户的实际意义
WorkBuddy、Claude 与豆包均取得 99 分本题的关键不再是是否能“发现条款不公平”,而是谁能把多个收费出口同步关闭,并形成可继续谈判的 Word。
Codex 得分较低但仍完成核心修订说明执行总分受工具、运行和文档等维度影响,不能据此直接判断法律修订明显较差。
DeepSeek 识别第 7.2/7.6 冲突边界披露与关键问题识别可以作为初筛价值,但仍需看替换、退款、保护期和责任闭环是否完整。
多数 Agent 会自行填入保证期和退款比例费率、90/180 日保证期、阶梯退款与年度封顶都属于需要 HR、采购、财务和法务批准的参数,不应被 AI 默认成机构立场。
CASE 03 · OUTSOURCED OPERATIONS

案例三:客户运营外包——一份很专业的 Word 为什么仍需被拦下

这道题同时触及服务外包、人员管理、事实用工、劳务派遣、按人头计价和退出成本。它最能暴露“局部写得非常专业,但关键链条仍然断裂”的 failure mode。

C1 直接管理采购方可以直接下达任务、确认班次并影响绩效排班。
C2 成本转嫁减少人员、要求退出或提前终止时,安置和待岗成本转给采购方。
C3 按人头计价18 人基础配置与新增人员单价强化“购买劳动力”的外观。
C4 声明替代行为只写“不构成劳动关系”,缺少工牌、邮箱、考勤、绩效等隔离。
C5 追偿不足重新定性与用工责任可能落入一般责任上限。

Claude:2.3 改了,2.4 没改,12.4 新增

证据说明
图 5|第 2.3 条。将任务、排班、考勤、培训、绩效、奖惩转回服务商项目负责人,采购方只对服务成果提出要求。
证据说明
图 6|第 2.4 条。人员减少、退出或提前终止造成的安置、经济补偿和待岗成本仍由采购方承担,关键条款未被修改。
证据说明
图 7|新增第 12.4 条。增加独立管理、工牌邮箱隔离、社保核验与重新定性赔偿,局部处理非常专业。

法律闸门结论:WARN

第 2.4 条继续转嫁人员退出和法定用工成本,也强化采购方决定人员去留的外观。即使第 2.3 条和第 12.4 条的论证很完整,这一个 critical 遗漏仍足以阻止结果直接进入谈判。

对照:WorkBuddy 怎样处理同一相邻条款

证据说明
图 8|第 2.4 条限缩。仅补偿实际、有凭证、不可避免的合理成本,并要求服务商先减损,同时设置单人两个月服务费上限。
证据说明
图 9|新增行为隔离。进一步明确服务商独立行使用工管理权,服务人员不纳入采购方组织架构。

本题说明了什么

外包合同不能只靠“不构成劳动关系”的声明。最低完整链条应当包括:采购方只管理服务成果,服务商管理个人;工牌、邮箱、考勤、绩效、福利和社保形成行为隔离;计价体现服务成果而不是劳动力投入;人员退出成本有边界;服务商承担合法用工义务;重新定性后的责任能够追偿;实际运营与合同文字一致并保留证据。

这也是法律专家审查与普通文档评估最明显的区别:一份文档可以在多数页面上表现专业,仍然因为相邻条款的一个结构性遗漏而不能交付。

PART 4 · AGENT PROFILES

六款 Agent 的本期能力剖面

以下判断仅针对本期三份合同与特定运行环境,目的是帮助用户理解任务匹配与人工接管点,不构成长期排名。

Claude
本期优势

风险、依据、修订、谈判理由和事实缺口之间连接较完整,复杂 issue 的论证更接近资深法律底稿。

必须防范

高质量局部内容可能掩盖相邻 critical 遗漏。复杂合同应使用专属清单逐项复核,不能凭整体阅读感放行。

WorkBuddy
本期优势

条款覆盖、谈判分层、待办与退让线展开充分,尤其适合把审核结果组织成下一轮业务和法务工作。

必须防范

理想值、底线和比例仍需机构授权;修订较多时,要压缩成签约前提、原则上应改和可交换项。

豆包
本期优势

原生 Word 修订和批注成熟,编号、格式与可审阅性稳定,证明办公型 Agent 已能承担大量执行劳动。

必须防范

文档做得完整并不等于关键目标已守住。必须用 critical 卡检查正文和附件是否真正同步修改。

Codex
本期优势

工具链、检索、批量修改和广覆盖能力突出,适合复杂材料处理与可编程工作流。

必须防范

调用次数与批注密度不等于法律价值。需要把每次检索和修改映射到具体 issue,并删减无优先级的过度修订。

通义千问
本期优势

修改相对克制,部分任务的关键问题覆盖较好,有助于减少为“显得认真”而做的无效改动。

必须防范

克制必须建立在 critical 已全部覆盖的前提上。少改不能成为漏掉决定性问题的理由。

DeepSeek
本期优势

能够披露模型知识、检索和法务核验边界,较少把不确定结论直接包装成确定事实。

必须防范

免责声明只是合格底线,不能补偿复杂风险覆盖、可执行条款和责任闭环不足。更适合线索发现与低风险初筛。

六类最值得监测的失败模式

失败模式表现法律影响
立场失败甲乙方方向、交易目标或谈判位置判断错误。整份修订可能系统性保护了错误的一方。
事实失败把缺失附件、未知时间、预算和商业参数当成确定事实。结论建立在不存在的事实基础上,容易误导签约。
关键风险失败一般风险很多,但漏掉决定交易成败的 issue。文档看起来专业,核心目标仍然没有保护。
策略失败知道风险,却只写“建议修改”,没有可谈判条款。结果不能直接进入下一轮业务动作。
责任失败没有指出谁补事实、谁决定参数、谁批准。“人工复核”成为没有负责人和证据的口号。
控制失败依据、版本、权限和修改过程不可追溯。无法复盘,也无法在产品升级后做回归验证。
PART 5 · SELECTION FRAMEWORK

测完以后,怎样选择 Agent、MCP、Skill 与工作台

“工具不够好”并不是一个可执行诊断。用户需要根据失败发生的位置,判断该更换什么、补充什么,以及哪些问题只能由人决定。

文件读取、附件、格式、批注或原生修订失败
优先更换 Agent 或原生工作流
这说明任务还没有被完整执行,先不要用更多法律资料掩盖执行能力不足。
结论依赖最新法律、案例或监管材料,但来源过时或无法核验
接入法律 MCP
同时要求来源进入具体 issue,而不是只展示检索次数。
Word 做得很好,但反复漏掉同类 critical 或修改结构不稳定
增加或重写合同审核 Skill
把任务步骤、专属 issue map、处理标准和验收闸门固化下来。
每次换对话都要重新讲事实,版本、依据、待办和审批散落
进入法律 AI 工作台
工作台解决事项状态、多人协作、证据链与责任闭环。
涉及费率、违约金、责任上限、保证期或重大残余风险
设置人工 Gate
AI 可以提出选项,不能决定机构风险偏好或最终签发。

五个组件分别解决什么

Agent决定任务能不能从文件读取一直做到最终交付。
MCP决定外部依据能不能被找到、引用和核验。
Skill决定同类任务能不能按照稳定的方法和标准做对。
工作台决定事项、版本、证据、权限和审批能不能被持续管理。
人决定真实事实、风险取舍、商业参数与最终签发。

不要把组件当成替代关系

一个成熟的法律 AI 工作方式通常同时需要:能执行的 Agent、可核验的 MCP、稳定的 Skill、承接责任的工作台,以及明确的人工权限。复测的作用,是告诉你当前最先需要补哪一块。

根据结果决定使用层级

R0 不可使用

站错立场、虚构、重大遗漏、无法形成 Word 或过程不可追溯。停止用于该任务,先诊断配置。

R1 风险线索

能指出部分问题,但 critical、条款方案或事实边界不足。只作为提示,由律师重新分析。

R2 专业底稿

多数关键问题和 Word 可用,但必须按合同专属清单补审,未经复核不得外发。

R3 受控候选

多样本回归稳定,critical、证据、版本和审批完整。在限定合同类型下受控使用。

本期单次横评最多支持 R1—R2 的初步判断。任何产品进入 R3,都需要同类合同的多样本、变体测试、版本回归和真实组织流程验证。

PART 6 · 30-MINUTE RE-RUN

拿起测试包:30 分钟完成你的第一次复测

第一次建议只测试 P1-002 猎头服务采购合同。它的费用、保证期、替换与退款结构容易理解,能够较快区分“会指出问题”和“能形成法律机制”。

运行前:只记录六项配置

配置项你需要记录什么
产品 / Agent具体产品名称和运行入口。
模型与版本当前选择的模型、日期及可见版本。
MCP是否接入法律数据库;具体名称;是否真的返回可用来源。
Skill是否加载合同审核 Skill;名称和版本。
Word 能力能否读取原始 DOCX,并输出原生修订和批注。
人工干预运行中是否补充法律思路、修复工具或提供答案。

只给 Agent 两个文件

01|任务说明

明确代表服务购买方、预算有限、费用需要与实际服务价值匹配,并要求原生修订 Word、批注和 assumptions。

02|原始合同

不要提供 checklist、标准答案、专属评价卡或其他 Agent 输出。测试要观察它是否能够独立识别。

运行后:用“法律五问 + 执行一问”判断

判断合格表现
1. 立场和目标围绕预算有限、费用与实际服务价值匹配展开,没有做成双方平均平衡的通用审查。
2. 事实与假设预算、职位数量、费率、保证期、资质和跨境 ATS 等被列为待确认,没有擅自确定。
3. critical 覆盖同时发现 Offer 付款、未入职不退、费用圈地、第 7.2/7.6 冲突和替换失败无现金退款。
4. 解决方案形成“有效推荐—实际入职—阶段付款—保证期—替换或退款—超期现金退款”的完整机制。
5. 人工接管明确 HR、采购、财务、法务和授权人分别需要确认什么。
6. 原生 Word正文修订、批注、编号、交叉引用和附件没有明显破坏,可以继续复核。

最重要的判断规则

任何一个决定收费或保证责任的 critical 没有被有效处理,都不能因为文档很长、批注很多或语言专业而直接进入谈判。先标记失败位置,再决定是换 Agent、接 MCP、补 Skill,还是交给人工。

完成一次测试后,你应该得到三个答案

  1. 这套工具在该任务上属于 R0、R1、R2 还是 R3 候选;
  2. 当前最大的瓶颈位于 Agent、MCP、Skill、工作台还是人工权限;
  3. 下一轮复测应该保持哪些变量不变,改变哪一个变量来验证改进。
PROGRAM VALUE

持续监测的价值:让每次工具变化都不再从零开始

本期只围绕合同审核 Agent。年度监测的真正价值,是把同样的方法扩展到法律检索、案件分析、合规评估、隐私政策、尽职调查和其他真实任务,并在工具更新后持续复跑。

单期报告解决一次判断

你能够拿到真实任务、脱敏样本、评测方法、法律专家结论和复跑工具,知道一款产品当前是否值得尝试、能够用到哪一步、失败后应该补什么。

年度会员形成长期资产

随着监测期数增加,你会逐步形成自己的任务测试库、合同专属 issue map、Agent 与 MCP 配置经验、经验证的 Skill、人工复核 Gate 和版本回归记录。

法律 AI 监测与实测的标准交付

每期交付用户能够完成的动作
趋势与变化判断知道哪些更新值得投入时间,哪些只是功能新闻。
任务卡与脱敏样本无需自己编题,直接在当前 Agent 上复跑。
统一运行与证据要求避免不同底稿、不同权限和答案污染造成假比较。
法律专家框架与专属 critical从“看起来专业”进一步判断是否真正保护了委托方。
Agent / MCP / Skill 配置建议根据失败位置选择工具,而不是继续盲目叠加产品。
版本复测与案例诊所产品升级后重新验证,并将真实使用问题带入直播和社群讨论。

年度会员最终留下什么

不是一堆很快过时的产品新闻,而是一套持续更新的法律 AI 判断能力:看到新工具,知道值不值得试;拿到测试包,知道怎么测;测完以后,知道怎么配置、怎么用、哪里必须由人负责。

把每次复测沉淀为六类可复用资产

任务基线
GO、原始样本、输入 hash 与交付要求。
配置快照
Agent、模型、MCP、Skill、权限和版本。
交付证据
修订 Word、批注、assumptions 与运行记录。
法律判定
critical 覆盖、PASS/WARN/FAIL 与 R0–R3。
人工决定
待确认事实、风险接受、参数与最终签发。
版本回归
保持基线不变,记录升级前后的真实差异。
JOIN THE PROGRAM

加入星月计划,持续获得法律 AI 监测与实测

28 节系统课程、12 场直播与案例诊所、4 次阶段实践和全年持续更新。法律 AI 监测不是独立的一份报告,而是把新工具、新方法和真实法律任务持续带入学习、复测与工作台建设的全年权益。

本期报告与测试包提供一次完整体验;年度会员获得后续监测、复跑任务、案例诊所与持续更新。

前往微店了解与购买

课程权益以正式购买页面显示为准。