中文 English

您当前所在位置:首页 > 新闻资讯

新闻资讯

观点丨关于隐式节点机制的实测发现及其评分影响

时间:2026-03-12

编者按:组委会本来无意设计隐式节点。只是发的示例里节点部分遗漏了一些规则中用到的节点。评测工具为了能让链图JSON更易执行,所以是先在规则部分找基础节点,然后到节点部分找提示词,如果找不到这个节点或者没有提示词,就会按照默认的问题去提问。目前尚不确定隐式节点是否会影响还原度,不过此前对赛队的要求是所有规则里的字符串都要在节点部分定义,不要有隐式节点。非常感谢赛队的思考,持续欢迎大家来投稿!!



关于隐式节点机制的实测发现及其评分影响——对链图JSON节点设计的补充观察


进击的吴枫赛队,南昌大学、江西财经大学


中国社会科学院大学“Hello World, Hello Law 队”发表从“鉴定式分析”到“计算表达”:关于比赛评分逻辑的共识、澄清与建议一文,从法理角度重构了可拓展性的内涵,提出以裁判时与行为时的双重时间维度理解声明效力期间,认为可拓展性测试考察的应是模型是否内置了从旧兼从轻的溯及力规则。Z-ONE队智能体赛道“还原性”与“可扩展性”的规则悖论在此基础上进一步指出:若将上述溯及力规则写入JSON本体,还原出的自然语言势必超出单一输入法条的范围,导致语义相似度下降,形成“还原性与可扩展性的规则悖论”。

在参赛过程中,我们注意到一个尚未被讨论的具体机制,在节点设计层面制造了与上述悖论性质相同的两难。以下就此作一补充,并提出若干处理思路,供组委会参考。

一、隐式节点机制的发现与实测

在拆解官方醉驾示例JSON时,我们发现了一处值得关注的格式现象:醉驾链图中“存在从重处罚情节”这条OR门规则的条件数组包含11条字符串,但检索整个节点数组,这11条一条都未经声明——醉驾示例的节点数组中只有4个显式节点。由此推断:测试工具在执行时,对于规则条件中出现的、既不是节点名称也不是任何规则结果名的字符串,会将其直接作为问题向大模型提问,自动作为布尔节点处理,无需在节点数组中预先声明。

为验证这一推断,我们以血液酒精含量135mg/100ml、在高速公路上驾驶机动车为简单案件事实,对官方醉驾链图进行了完整测试。测试工具的执行日志显示,上述11条未声明字符串被逐一提问,其中“在高速公路……醉酒驾驶”被判断为True,“存在从重处罚情节”因此成立,刑期起点进入“+60天”分支,最终宣告刑期222.5天,推理链条完整跑通,未出现任何报错。隐式节点机制由此得到确认。

测试日志中还出现了一个反向结果:唯一答错的节点是显式声明的刑期起点初始值,被填入了135——与血液酒精含量相同,原因在于该节点的提示词只有“刑期起点初始值为多少”七个字,未说明单位和取值依据。11个隐式节点反而全部答对。这说明显式声明本身并不保证答题质量,提示词设计才是关键;示例在这个节点上存在明显的提示词质量缺陷。

二、节点设计的取舍

隐式节点机制对节点设计产生了方向相反的两种影响。

从还原度的角度,使用隐式节点是有利的。根据评分细则,还原度评测的流程是将JSON输入大模型,还原为自然语言,再与原始法条计算语义相似度。节点数组中若存在大量与规则条件文字高度重叠的显式条目,还原后的文本会出现明显冗余,拉低相似度得分。使用隐式节点可以避免这种冗余。

从准确率的角度,隐式节点意味着完全放弃对该节点提示词的控制。测试工具直接以节点名称为问题向大模型提问,无法针对具体法律要件的认定细节作引导。以帮信罪为例,“被帮助对象数量”的认定需要特别说明“为同一对象多次提供帮助仍计为一个”;对于“综合认定行为人主观明知”这类需要综合判断的节点,以节点名直接提问极易得到不稳定的答复。这类细节在隐式节点下无从传达。

显式声明节点有利于准确率,隐式节点有利于还原度,参赛者在声明方式上都面临取舍。

三、同一结构根源

这一节点设计上的两难,与Z-ONE赛队指出的时间路由问题,根源上出自同一处:判决预测准确率测试(20分)的执行过程与参赛队伍提交的工作流完全隔绝。

根据评分细则,准确率测试的执行方式是:组委会将工作流事先生成的静态链图JSON和任务节点JSON直接交给测试工具,由测试工具调用外部大模型,对测试集案件逐节点提问、沿规则链推导结论。这是一个静态JSON文件独立运行的过程,工作流在此阶段不再介入。因此,凡是设计在工作流层面而未落入JSON文本的任何逻辑,在准确率测试中均形同不存在。若参赛队伍在工作流中设计了精细的节点提示词管理或时间路由逻辑,但这些逻辑未体现在最终提交的静态JSON里,准确率测试对此一无所知。

需要说明的是,这一隔绝关系仅适用于准确率测试。同案由可拓展性测试的机制有所不同:组委会将不同效力期间的法条输入工作流,工作流重新生成JSON,考察的是工作流本身处理陌生法条的能力,工作流全程参与其中。因此Z-ONE赛队所指出的时间路由矛盾,在准确率测试维度上确实成立;而节点设计的问题,则同时贯穿还原度与准确率两条评测路径,影响范围更广。

四、建议

以上矛盾参赛者们难以自行化解,提出三项处理思路供组委会参考。

(1)在评分细则中明确隐式节点的还原度处理规则。建议规定还原度评测时,大模型的还原对象以节点数组中显式声明的节点为准,规则条件中未声明的隐式字符串不纳入还原比对范围。此举无需修改任何技术实现,仅需在评分说明中增加一条规则,便可消除参赛者在节点声明方式上的策略两难。

(2)对于准确率测试,建议明确公开测试集的时间范围。若测试案件均来自声明效力期间内,Z-ONE赛队所指出的时间路由悖论自然消解;若测试集涵盖跨时期案件,则还原度比对的基准范围应相应调整,避免参赛者因在JSON中补充溯及力规则而在还原度上受到惩罚。

(3)退一步说,若上述调整均暂不具备条件,建议至少向参赛队伍完整公开测试工具对节点声明的处理逻辑,使参赛者能在知情的前提下作出节点设计决策,而非在得分方向相反的两种选择之间盲目权衡。

本文基于参赛实践与赛事规则文本撰写,如有不当,欢迎批评指正。



图片







编辑:龙   凤

责编:庄涵麟


✦  +

+




图片

智慧法治研究所

laiwlab@scu.edu.cn