从产品变化,到可验证的使用决定
法律 AI 的更新越来越快,但真正稀缺的并不是“知道哪个产品又更新了”,而是能够在真实法律任务中验证:它是否适合自己的工作、需要怎样配置、能安全使用到哪一步、哪里必须由人接管。
本报告属于“星月计划·法律 AI 监测与实测”系列研究成果。它同时承担三项任务:解释本期评测如何完成;用实际合同证据说明不同 Agent 的能力边界;提供一套可直接复跑的测试方法,帮助读者在自己的工作环境中重新验证。
年度会员每期得到的,不是一条新闻,而是一套验证单元
| 变化筛选 | 从模型、Agent、MCP、Skill 和工作流更新中,筛出真正可能影响法律任务与交付方式的变化。 |
| 真实任务与样本 | 提供已经定义好代表立场、业务目标、输入材料和交付要求的脱敏法律任务,减少从零设计测试的成本。 |
| 统一测试方法 | 冻结材料、权限、工具和输出,避免因为随手提问、答案污染或不同底稿而得出失真的结论。 |
| 法律专家判定 | 进入实际 Word,判断立场、事实、critical issue、依据、修订方案和人工责任是否形成完整链条。 |
| 配置与使用建议 | 根据失败位置判断应当更换 Agent、接入 MCP、增加 Skill、进入工作台,还是设置人工 Gate。 |
| 版本回归 | 模型、工具或方法更新以后,使用同一测试包复跑,验证能力是否真的改善,而不是凭产品宣传作判断。 |
读者可以怎样使用本报告
10 分钟:阅读执行摘要与总体结果,理解本期结论。30 分钟:使用猎头服务采购任务完成第一次复测。进一步部署:使用三份合同的专属 critical 卡,对自己的 Agent、MCP 和 Skill 做回归验证。
研究边界:本期结果来自特定时间、版本、权限和一次正式运行,不构成任何产品的永久能力排名、采购背书或法律意见。不同平台的 Token、积分与金额口径不一致,不用于法律质量比较。
执行摘要
端到端“跑完”与法律上“可交付”是两种判断
直播百分制能够观察 Agent 是否理解任务、使用工具、修订 Word 并保留过程证据,但法律交付不能只看总分。只要站错立场、混淆事实、漏掉关键风险,或者修订没有真正进入合同,其他维度的得分不能将其平均掉。
原生 Word 能力正在成熟,critical 闸门却仍然不可省略
多款 Agent 已能在原合同上保留编号、格式、修订和批注,这说明办公执行已经进入可用阶段。但 P1-003 中,Claude 对第 2.3 条和新增第 12.4 条的处理非常专业,却遗漏了相邻第 2.4 条的人员退出成本转嫁,仍需判定为必须补审。
风险数量、检索次数和文档长度都不是法律价值的替代指标
在市场推广合同中,Codex 识别的预设风险数量最多,但最终质量并未按照风险数量排序;三题 MCP 调用总量最高的也是 Codex。检索只有进入具体 issue,改变风险判断、条款或谈判策略,才形成法律价值。
不同工具解决的是不同瓶颈,不能用同一种方式补救所有失败
无法稳定读取和修订 Word,首先是 Agent 或原生工作流问题;法源过时或无法核验,需要 MCP;Word 很完整但反复漏掉同类 critical,说明缺的是 Skill、issue map 和验收标准;跨对话的事项、版本与审批分散,则需要工作台。
年度监测的长期价值,是持续形成自己的测试资产
单期报告帮助用户完成一次判断;持续监测会逐步沉淀合同、检索、合规和案件任务的测试库,形成选型标准、验证过的 Skill、人工复核 Gate 与版本回归记录,使法律人面对新工具时不再从零开始。
本期一句话结论
本轮真正测出的不是“谁最会写”,而是六种方案距离可承担责任的法律交付还有多远,以及法律人应当怎样把 Agent、MCP、Skill、工作台与人工判断重新组合。
报告结构
本期基础材料
本报告基于三类脱敏合同、六款 Agent 的 18 份正式修订 Word、assumptions 与运行记录、直播评分底稿,以及法律专家复核框架形成。正文保留能够解释方法和选择的核心证据,未将全部修订、运行日志和密封答案逐页展开。
核心术语
| 术语 | 本报告中的含义 |
|---|---|
| Agent | 能够读取文件、调用工具、连续执行并形成交付物的原生工作环境,而非单次聊天回答。 |
| MCP | 向 Agent 提供外部法律数据库或其他工具能力的连接接口。本期主要观察法律查询工具的实际调用与可用性。 |
| Skill | 把任务步骤、判断方法、关键问题和验收标准固化为可复用能力,用于提高同类任务的一致性。 |
| critical issue | 一旦遗漏,就可能导致核心交易目标落空、重大法律责任继续敞口或结果无法进入真实流程的问题。 |
| 法律交付闸门 | 在总分之外,对立场、事实、critical、方案和人工责任进行阻断式检查,用来决定结果是否能进入谈判或签发。 |
研究设计:本期到底在测什么
本期没有测试“模型是否会谈论合同风险”,而是测试从原始合同到可审阅 Word 的完整工作链。被比较的对象不是裸模型,而是原生模型 + 原生 harness + 可用工具与资料权限 + 交付工作流。
三类合同分别测试三种法律工作
| 任务 | 代表立场与业务目标 | 为什么选择这一类合同 |
|---|---|---|
| P1-001 市场推广 | 弱势甲方;新品必须按指定时间、指定渠道发布。 | 测试 Agent 能否围绕一个不可失守的业务目标,识别正文与附件冲突,并在首发窗口关闭前建立预警、替代和救济。 |
| P1-002 猎头采购 | 服务购买方;预算有限,费用必须与实际服务价值匹配。 | 测试 Agent 能否把有效推荐、入职、付款、保证期、替换与退款组织成一条完整收费机制,而非只评价“条款不利”。 |
| P1-003 客户运营外包 | 服务购买方乙方;谈判地位均衡。 | 测试 Agent 能否同时处理直接管理、事实用工、劳务派遣、按人头计价、人员退出成本与数据等结构性问题。 |
统一测试条件
固定输入
每个任务使用同一原始 DOCX、同一任务说明和相同的文件边界。测试中不向 Agent 提供 checklist、标准答案或其他产品输出,避免把独立风险识别变成答案复述。
固定交付
最终必须在原合同上使用 Word 原生修订和批注,另存修订 DOCX,并输出 assumptions。不得另写一份新合同,也不得把 Markdown 或 HTML 重新生成成 Word。
记录差异
记录模型与产品版本、工具调用、运行时间、失败与人工干预。不同平台的工具可用性与 Token 口径并不完全一致,因此资源数据只用于解释工作方式。
法律基线先冻结
每份合同在查看 Agent 输出前建立专属 issue map,并将风险分为 critical、major 与 standard。这样可以防止看完结果后,为喜欢的输出倒推评分标准。
证据限制
每款 Agent 每题只保留一次正式运行,本报告不能证明跨版本稳定性;本期没有完整双评分者一致性数据,不能把相差数分解释为确定能力差距;第三题包含连续上下文因素,三题之间不宜计算平均分。
法律专家框架:从执行分到交付闸门
合同审核不是文本生成,而是一条法律论证与决策链。能够发现风险只是起点;真正可用的结果还要把事实、依据、修改、谈判和责任连接起来。
第一层:端到端执行观察分
| 维度 | 分值 | 观察内容 |
|---|---|---|
| A 任务理解 | 20 | 是否理解角色、目标、输入、输出和边界。 |
| B 工具与资料 | 20 | 是否读取材料、使用合同库和法律检索,并避免无效调用。 |
| C 风险识别 | 25 | 是否发现预设风险并形成合理优先级。 |
| D Word 交付 | 20 | 是否在原始 DOCX 上形成可审阅修订、批注和完整格式。 |
| E 可验证与可控 | 15 | 是否披露假设、未决事项、工具和失败,过程是否可追溯。 |
这一百分描述的是“Agent 完成整个任务包的质量剖面”。由于风险识别只占 25 分,工具与 Word 合计占 40 分,它不能单独回答律师能否签发。
第二层:法律交付闸门
| 状态 | 判断标准 | 允许用途 |
|---|---|---|
| PASS 可进入人工主导的谈判准备 | 立场正确;关键事实边界清楚;全部 critical 有有效处理;方案可执行;人工节点明确。 | 作为律师或法务谈判底稿,仍需复核和批准。 |
| WARN 必须补审 | 存在 1 个 critical 未识别或未有效写入;关键事实未闭环;方案只有评价没有条款;法源或责任不完整。 | 作为问题线索或初稿,先补审指定问题。 |
| FAIL 不得进入业务流程 | 站错立场;虚构决定性事实或法源;漏掉 2 个以上 critical;未经授权接受重大风险;输出不可追溯。 | 仅用于诊断工具问题,不得向业务发送。 |
什么时候才算真正覆盖一个风险
至少要同时完成四件事:定位具体条款或缺失材料;解释它如何影响委托方;处理为可执行的修订、删除、新增或阻断建议;交接不能由 AI 确认的事实、数字和风险偏好。只写“建议明确”“建议法务核验”,不算完整覆盖。
总体结果:分数可以比较,结论不能简化成排行榜
下表沿用直播中的内部最终分。它反映每款 Agent 在特定任务中的执行完成度,但不宜跨题计算平均分,也不能绕过合同专属 critical 闸门。
| Agent | P1-001 市场推广 | P1-002 猎头采购 | P1-003 运营外包 | 本期最值得关注的信号 |
|---|---|---|---|---|
| WorkBuddy | 88 | 99 | 98 | 谈判分层、待办组织与相邻风险闭环较充分。 |
| Claude | 88 | 99 | 84 | 论证链完整,但 P1-003 出现“高质量局部 + critical 遗漏”。 |
| Codex | 85 | 81 | 89 | 工具与广覆盖能力突出,需把投入压缩为优先级和证据链。 |
| 豆包 | 92 | 99 | 98 | 原生 Word 执行成熟,仍需逐项 critical 验收。 |
| 通义千问 | 85 | 87 | 91 | 修改相对克制,关键在于少改是否仍覆盖决定性风险。 |
| DeepSeek | 67 | 90 | 79 | 会披露知识边界,但复杂风险覆盖与方案闭环不足。 |
风险发现数量与法律交付质量并不线性
P1-001 的预设风险命中数量如下。Codex 的命中最多,但总分没有同步成为第一;WorkBuddy 和 Claude 的命中数量不占优势,却能够在部分核心问题上形成更完整的发布保护链。
解释重点:命中风险只是“看到了”。法律专家还要判断是否站对立场、是否抓住核心目标、是否形成可执行修订、是否把事实与决定交回正确的人。
运行效率与 MCP 调用:用于解释工作方式,不用于加法律分
| Agent | 三题运行时长 | 法律 MCP 总调用 | 使用解释 |
|---|---|---|---|
| WorkBuddy | 约 22—35 分钟 | 39 | 工具调用与谈判工作底稿组织较均衡。 |
| Claude | 约 23—28 分钟 | 30 | 检索较多进入具体论证与条款理由。 |
| Codex | 约 21—44 分钟 | 70 | 调用最多,但法律价值取决于是否进入关键 issue。 |
| 豆包 | 约 25—34 分钟 | 21 | 部分任务存在工具可用性波动,Word 执行仍较完整。 |
| 通义千问 | 约 24—28 分钟 | 26 | 调用相对克制,需看是否支持关键结论。 |
| DeepSeek | 约 9—14 分钟 | 0 | 本轮未形成同等法律 MCP 结果,不能据此认定不检索。 |
案例一:新品发布合同——风险必须在窗口关闭前被真正解决
这道题的难点不是发现一般免责条款,而是保护弱势甲方唯一不可失守的目标:智能手表新品必须在指定时间、指定渠道按约发布。
最低合格的法律保护链
定义上市日与统一解禁时间;禁止提前发布;将“±1日”改为仅允许上市日或次日;提前逐一锁定媒体与版位;未锁定时同步提供同等级替代资源;甲方反馈只允许受影响单项顺延;在窗口关闭前设置催告、资源移交和替代履行。
法律专家怎样解释这份输出
Claude 的价值不在于“发现发布时间问题”,而在于把商业目标、合同证据、风险、事前控制和人工事实交接连接起来。实际 Word 中还出现了上市日前五个工作日锁定 8 家核心媒体、把资源降档标准中的“均”改为“任一项”、以及逾期未补救时允许甲方替代履行并要求移交资源和付款凭证等处理。
与此同时,真实解禁时刻、媒体与 KOL 锁定状态、节假日排期、预算、违约金和内容复用范围仍需业务与法务确认。专业输出应当显化这些未知,而不是替用户作决定。
六款 Agent 在本题分别揭示了什么
| Agent | 本题观察 | 进入谈判前的人工重点 |
|---|---|---|
| Claude | 形成定义—锁位—顺延边界—替代履行的完整链条之一。 | 确认真实解禁时间、版位事实、违约金和退让空间。 |
| WorkBuddy | 建立刚性节点、替代履行,并将多项修改分成必争与可退让。 | Agent 建议的 10%、20%、30% 等比例必须由授权人批准。 |
| 豆包 | 原生修订和批注完整,覆盖顺延、锁位、付款、合规与责任。 | 逐字确认“均显著低于”是否真正改掉,不能只看批注数量。 |
| Codex | 覆盖面广、MCP 调用多,风险数量最高。 | 将大量修改压缩为核心交易目标,删除谈判成本过高的次要修订。 |
| 通义千问 | 修改相对克制,包含锁位、提示和备选资源。 | 确认解禁、附件窗口、降档漏洞与替代履行是否全部闭环。 |
| DeepSeek | 能识别上市日重要性和部分责任问题,并披露知识边界。 | 补足定义—锁位—替代—窗口前救济的完整机制。 |
案例二:猎头服务合同——从“条款不利”到费用与服务价值闭环
猎头合同看起来比外包合同简单,却很容易在多个条款之间形成收费出口。真正的审核对象不是某一个费率,而是有效推荐、实际入职、付款、保证期、替换与退款之间是否一致。
最低合格的收费与保证机制
有效推荐应限定职位、完整简历、候选人同意和购买方接收;首期付款应后移至实际入职,余款与保证期或在职状态关联;未入职不收费或退款;保证责任不得被“个人原因”普遍免责架空;购买方可以在替换和退款之间选择,替换限期届满后转为现金退款。
为什么“改了一处付款条款”还不够
如果只把第 4.1 条的首期付款从 Offer 后移到入职,但仍保留宽泛的有效推荐、关联方收费、12 个月保护期和终止长尾,费用仍可能从其他条款重新产生。同样,如果第 7.2 条写明主动离职触发保证,第 7.6 条又以“个人原因”普遍免责,保证机制仍会被架空。
因此,猎头合同的专业判断应当沿着一条连续链条验收:有效推荐 → 实际入职 → 阶段付款 → 保证期 → 离职触发 → 替换或退款 → 替换失败后的现金救济。
本题对工具选择的启示
| 观察 | 对用户的实际意义 |
|---|---|
| WorkBuddy、Claude 与豆包均取得 99 分 | 本题的关键不再是是否能“发现条款不公平”,而是谁能把多个收费出口同步关闭,并形成可继续谈判的 Word。 |
| Codex 得分较低但仍完成核心修订 | 说明执行总分受工具、运行和文档等维度影响,不能据此直接判断法律修订明显较差。 |
| DeepSeek 识别第 7.2/7.6 冲突 | 边界披露与关键问题识别可以作为初筛价值,但仍需看替换、退款、保护期和责任闭环是否完整。 |
| 多数 Agent 会自行填入保证期和退款比例 | 费率、90/180 日保证期、阶梯退款与年度封顶都属于需要 HR、采购、财务和法务批准的参数,不应被 AI 默认成机构立场。 |
案例三:客户运营外包——一份很专业的 Word 为什么仍需被拦下
这道题同时触及服务外包、人员管理、事实用工、劳务派遣、按人头计价和退出成本。它最能暴露“局部写得非常专业,但关键链条仍然断裂”的 failure mode。
Claude:2.3 改了,2.4 没改,12.4 新增
法律闸门结论:WARN
第 2.4 条继续转嫁人员退出和法定用工成本,也强化采购方决定人员去留的外观。即使第 2.3 条和第 12.4 条的论证很完整,这一个 critical 遗漏仍足以阻止结果直接进入谈判。
对照:WorkBuddy 怎样处理同一相邻条款
本题说明了什么
外包合同不能只靠“不构成劳动关系”的声明。最低完整链条应当包括:采购方只管理服务成果,服务商管理个人;工牌、邮箱、考勤、绩效、福利和社保形成行为隔离;计价体现服务成果而不是劳动力投入;人员退出成本有边界;服务商承担合法用工义务;重新定性后的责任能够追偿;实际运营与合同文字一致并保留证据。
这也是法律专家审查与普通文档评估最明显的区别:一份文档可以在多数页面上表现专业,仍然因为相邻条款的一个结构性遗漏而不能交付。
六款 Agent 的本期能力剖面
以下判断仅针对本期三份合同与特定运行环境,目的是帮助用户理解任务匹配与人工接管点,不构成长期排名。
风险、依据、修订、谈判理由和事实缺口之间连接较完整,复杂 issue 的论证更接近资深法律底稿。
高质量局部内容可能掩盖相邻 critical 遗漏。复杂合同应使用专属清单逐项复核,不能凭整体阅读感放行。
条款覆盖、谈判分层、待办与退让线展开充分,尤其适合把审核结果组织成下一轮业务和法务工作。
理想值、底线和比例仍需机构授权;修订较多时,要压缩成签约前提、原则上应改和可交换项。
原生 Word 修订和批注成熟,编号、格式与可审阅性稳定,证明办公型 Agent 已能承担大量执行劳动。
文档做得完整并不等于关键目标已守住。必须用 critical 卡检查正文和附件是否真正同步修改。
工具链、检索、批量修改和广覆盖能力突出,适合复杂材料处理与可编程工作流。
调用次数与批注密度不等于法律价值。需要把每次检索和修改映射到具体 issue,并删减无优先级的过度修订。
修改相对克制,部分任务的关键问题覆盖较好,有助于减少为“显得认真”而做的无效改动。
克制必须建立在 critical 已全部覆盖的前提上。少改不能成为漏掉决定性问题的理由。
能够披露模型知识、检索和法务核验边界,较少把不确定结论直接包装成确定事实。
免责声明只是合格底线,不能补偿复杂风险覆盖、可执行条款和责任闭环不足。更适合线索发现与低风险初筛。
六类最值得监测的失败模式
| 失败模式 | 表现 | 法律影响 |
|---|---|---|
| 立场失败 | 甲乙方方向、交易目标或谈判位置判断错误。 | 整份修订可能系统性保护了错误的一方。 |
| 事实失败 | 把缺失附件、未知时间、预算和商业参数当成确定事实。 | 结论建立在不存在的事实基础上,容易误导签约。 |
| 关键风险失败 | 一般风险很多,但漏掉决定交易成败的 issue。 | 文档看起来专业,核心目标仍然没有保护。 |
| 策略失败 | 知道风险,却只写“建议修改”,没有可谈判条款。 | 结果不能直接进入下一轮业务动作。 |
| 责任失败 | 没有指出谁补事实、谁决定参数、谁批准。 | “人工复核”成为没有负责人和证据的口号。 |
| 控制失败 | 依据、版本、权限和修改过程不可追溯。 | 无法复盘,也无法在产品升级后做回归验证。 |
测完以后,怎样选择 Agent、MCP、Skill 与工作台
“工具不够好”并不是一个可执行诊断。用户需要根据失败发生的位置,判断该更换什么、补充什么,以及哪些问题只能由人决定。
优先更换 Agent 或原生工作流
这说明任务还没有被完整执行,先不要用更多法律资料掩盖执行能力不足。
接入法律 MCP
同时要求来源进入具体 issue,而不是只展示检索次数。
增加或重写合同审核 Skill
把任务步骤、专属 issue map、处理标准和验收闸门固化下来。
进入法律 AI 工作台
工作台解决事项状态、多人协作、证据链与责任闭环。
设置人工 Gate
AI 可以提出选项,不能决定机构风险偏好或最终签发。
五个组件分别解决什么
| Agent | 决定任务能不能从文件读取一直做到最终交付。 |
| MCP | 决定外部依据能不能被找到、引用和核验。 |
| Skill | 决定同类任务能不能按照稳定的方法和标准做对。 |
| 工作台 | 决定事项、版本、证据、权限和审批能不能被持续管理。 |
| 人 | 决定真实事实、风险取舍、商业参数与最终签发。 |
不要把组件当成替代关系
一个成熟的法律 AI 工作方式通常同时需要:能执行的 Agent、可核验的 MCP、稳定的 Skill、承接责任的工作台,以及明确的人工权限。复测的作用,是告诉你当前最先需要补哪一块。
根据结果决定使用层级
站错立场、虚构、重大遗漏、无法形成 Word 或过程不可追溯。停止用于该任务,先诊断配置。
能指出部分问题,但 critical、条款方案或事实边界不足。只作为提示,由律师重新分析。
多数关键问题和 Word 可用,但必须按合同专属清单补审,未经复核不得外发。
多样本回归稳定,critical、证据、版本和审批完整。在限定合同类型下受控使用。
本期单次横评最多支持 R1—R2 的初步判断。任何产品进入 R3,都需要同类合同的多样本、变体测试、版本回归和真实组织流程验证。
拿起测试包:30 分钟完成你的第一次复测
第一次建议只测试 P1-002 猎头服务采购合同。它的费用、保证期、替换与退款结构容易理解,能够较快区分“会指出问题”和“能形成法律机制”。
运行前:只记录六项配置
| 配置项 | 你需要记录什么 |
|---|---|
| 产品 / Agent | 具体产品名称和运行入口。 |
| 模型与版本 | 当前选择的模型、日期及可见版本。 |
| MCP | 是否接入法律数据库;具体名称;是否真的返回可用来源。 |
| Skill | 是否加载合同审核 Skill;名称和版本。 |
| Word 能力 | 能否读取原始 DOCX,并输出原生修订和批注。 |
| 人工干预 | 运行中是否补充法律思路、修复工具或提供答案。 |
只给 Agent 两个文件
01|任务说明
明确代表服务购买方、预算有限、费用需要与实际服务价值匹配,并要求原生修订 Word、批注和 assumptions。
02|原始合同
不要提供 checklist、标准答案、专属评价卡或其他 Agent 输出。测试要观察它是否能够独立识别。
运行后:用“法律五问 + 执行一问”判断
| 判断 | 合格表现 |
|---|---|
| 1. 立场和目标 | 围绕预算有限、费用与实际服务价值匹配展开,没有做成双方平均平衡的通用审查。 |
| 2. 事实与假设 | 预算、职位数量、费率、保证期、资质和跨境 ATS 等被列为待确认,没有擅自确定。 |
| 3. critical 覆盖 | 同时发现 Offer 付款、未入职不退、费用圈地、第 7.2/7.6 冲突和替换失败无现金退款。 |
| 4. 解决方案 | 形成“有效推荐—实际入职—阶段付款—保证期—替换或退款—超期现金退款”的完整机制。 |
| 5. 人工接管 | 明确 HR、采购、财务、法务和授权人分别需要确认什么。 |
| 6. 原生 Word | 正文修订、批注、编号、交叉引用和附件没有明显破坏,可以继续复核。 |
最重要的判断规则
任何一个决定收费或保证责任的 critical 没有被有效处理,都不能因为文档很长、批注很多或语言专业而直接进入谈判。先标记失败位置,再决定是换 Agent、接 MCP、补 Skill,还是交给人工。
完成一次测试后,你应该得到三个答案
- 这套工具在该任务上属于 R0、R1、R2 还是 R3 候选;
- 当前最大的瓶颈位于 Agent、MCP、Skill、工作台还是人工权限;
- 下一轮复测应该保持哪些变量不变,改变哪一个变量来验证改进。
持续监测的价值:让每次工具变化都不再从零开始
本期只围绕合同审核 Agent。年度监测的真正价值,是把同样的方法扩展到法律检索、案件分析、合规评估、隐私政策、尽职调查和其他真实任务,并在工具更新后持续复跑。
单期报告解决一次判断
你能够拿到真实任务、脱敏样本、评测方法、法律专家结论和复跑工具,知道一款产品当前是否值得尝试、能够用到哪一步、失败后应该补什么。
年度会员形成长期资产
随着监测期数增加,你会逐步形成自己的任务测试库、合同专属 issue map、Agent 与 MCP 配置经验、经验证的 Skill、人工复核 Gate 和版本回归记录。
法律 AI 监测与实测的标准交付
| 每期交付 | 用户能够完成的动作 |
|---|---|
| 趋势与变化判断 | 知道哪些更新值得投入时间,哪些只是功能新闻。 |
| 任务卡与脱敏样本 | 无需自己编题,直接在当前 Agent 上复跑。 |
| 统一运行与证据要求 | 避免不同底稿、不同权限和答案污染造成假比较。 |
| 法律专家框架与专属 critical | 从“看起来专业”进一步判断是否真正保护了委托方。 |
| Agent / MCP / Skill 配置建议 | 根据失败位置选择工具,而不是继续盲目叠加产品。 |
| 版本复测与案例诊所 | 产品升级后重新验证,并将真实使用问题带入直播和社群讨论。 |
年度会员最终留下什么
不是一堆很快过时的产品新闻,而是一套持续更新的法律 AI 判断能力:看到新工具,知道值不值得试;拿到测试包,知道怎么测;测完以后,知道怎么配置、怎么用、哪里必须由人负责。
把每次复测沉淀为六类可复用资产
GO、原始样本、输入 hash 与交付要求。
Agent、模型、MCP、Skill、权限和版本。
修订 Word、批注、assumptions 与运行记录。
critical 覆盖、PASS/WARN/FAIL 与 R0–R3。
待确认事实、风险接受、参数与最终签发。
保持基线不变,记录升级前后的真实差异。
加入星月计划,持续获得法律 AI 监测与实测
28 节系统课程、12 场直播与案例诊所、4 次阶段实践和全年持续更新。法律 AI 监测不是独立的一份报告,而是把新工具、新方法和真实法律任务持续带入学习、复测与工作台建设的全年权益。
本期报告与测试包提供一次完整体验;年度会员获得后续监测、复跑任务、案例诊所与持续更新。
课程权益以正式购买页面显示为准。
