法不净空,觉无性也。

第二十一章 评分怎样帮助又怎样误导

2026.09.13

一个分数先需要一套约定

周四十九点四十分,顾宁在校准页后写下评分问题。唐可希望有一个简短数字,能比较不同程度的报告,而不只是分别看每个概率组。顾宁说,可以采用评分,但要先讲清数字如何计算、越大还是越小越好。

上一章的校准页检查概率组与对应频率。评分则可以为每一份实际报告及其结果给一个数,再按明确范围汇总。两者有不同用途,一个平均分不能替每种条件的诊断。

本章继续虚构澄湾。十九点四十分没有新增委托方回复、完整确认或最终概率采用,R17还没有可正式评分的数值预测与结果配对。评分演算使用已明确的独立示例,不补成主线成绩。

我们选一种简单规则,让读者能逐项核对。目的不是给记录者一个永远可靠的排名,而是说明概率程度怎样接受结果约束,以及规则使用不当时怎样失去原问题。

本书使用肯定概率的平方差

对二选事件,肯定概率记为p,成立记Y=1,未成立记Y=0。本书采用单项Brier评分BS=(p-Y)²,并约定较小为好。若有n份适合相应评价的报告,平均分是这些单项平方差之和除以n。

Gneiting与Raftery在《严格适当评分规则、预测与估计》(2007)中讨论二次评分及严格适当规则。论文有采用较大为好的表达,我们在这里明确改用损失方向,不把不同方向的数混在一起。

还有一种按全部类别计算平方差之和的约定。在二选事件中,它将肯定与否定两类都计算,所得是本书单项值的两倍。统一倍数不改变同一范围内的排序,却会改变报出的分值尺度。

因此,看到另处的Brier分数,先问约定与方向。本书后文都按单肯定概率平方差,数值范围为零到一,越小越好。名称相同不意味着可以直接拿两个不同尺度的数字比较。

同一概率面对两种结果

若p=四分之三而Y=1,差为负四分之一,平方为十六分之一,即0.0625。若同一报告面对Y=0,平方为十六分之九,即0.5625。报告给予较高肯定程度,未成立时承担较大损失。

若p=二分之一,不论结果成立还是未成立,平方差都是四分之一。它没有因为语气中性就取得最好成绩,只是两种结果下的单项损失相同。

若报告一而结果成立,分值零;报告一而结果未成立,分值一。零分说明这一对报告与结果在该规则下完全贴合,不说明记录者在事前有充分依据采用一。

单项评分把程度与结果联系起来,却不能从实际结果反推出全部事前依据。没有依据的极端报告也可能一次取得零分;有支持的非极端报告则可能遇到较不利的实现结果。

一次较差成绩与诚实报告可以并存

设一个独立思想实验,记录者在现有信息下认真判断成立概率为四分之三。他按四分之三报告,后来事件却未成立,实际损失为十六分之九。

若他当时改报二分之一,这一次未成立会给四分之一,实际成绩更好。但这是已经看到结果以后比较的单次实现,不证明事前改报二分之一更符合他当时判断。

评分不承诺诚实报告每次都赢。它需要在结果尚未知的位置讨论,在记录者采用的概率下,怎样报告具有较小的期望损失。期望是按两种结果及其概率计算,不是事后只留下已发生的一种。

这一区别保护的不是任何人免受评价,而是评价的问题本身。实际较差分值应保留,也可以促使检查;但不能将每次较差结果都自动解释为不诚实或不该采用原概率。

期望损失怎样得到最小值

将记录者当时认真采用的肯定概率记为q,实际对外报告记为p。若依据q评价两种可能结果,期望平方损失为q(1-p)²+(1-q)p²。

展开后,它等于(p-q)²+q(1-q)。对固定q,第二项不随报告p改变,第一项在p=q时唯一为零。因此,在这个条件下,按q报告具有唯一最小的期望损失。

例如q=四分之三,报告p=q的期望损失是十六分之三,即0.1875;改报一或二分之一,期望损失都为四分之一。报一只看成立结果会更贴合,却还要面对四分之一概率的未成立。

这里q是思想实验中给定的认真判断,不是我们已经知道R17的真实概率。公式说明一种报告激励性质,不能替任意人的q取得充分材料,也不证明认真相信的概率已经校准。

严格适当是一项条件性质

Ranjan与Gneiting的《概率预测的组合》(2010)用较小为好的损失表述严格适当:按所评估的概率报告,期望损失应严格小于报告其他概率。它不是对每一次实际结果都成立的排名保证。

在上述演算中,前提包括结果按相应二选目标裁决,报告者以期望损失为比较标准,并且规则没有在别处悄悄改变。若评价目标变了,原性质也不能直接替新目标签字。

诚实报告与判断准确同样分开。一个人可以诚实报告材料不足的估计,后续频率却显示偏离;也可以故意改报一个数而恰好猜中。评分性质让人少一项改报的理由,不会自动补足观察与模型。

我们因此既检查报告规则,也检查原材料和持续表现。严格适当不是人物道德证书,而是一项可以在明确数学条件下说明的规则性质。

小账本的首次报告怎样汇总

回到上一章独立账本L01与L02。L01首次报告四分之一、结果未成立,损失十六分之一;L02首次报告四分之三、结果成立,损失也为十六分之一。两项首次报告的平均仍是十六分之一。

这个平均准确描述两条首次报告,不说明两位或一个记录者已经持续可靠。我们只有两个示例事件,也未给出结果独立或某个总体抽样假设。

L02后来更新为五分之三,同一成立结果下损失为二十五分之四,即0.16。这次更新的单项分值比首次报告大,可以如实记录,但不单凭一项结果否定更新时的全部依据。

若研究更新过程而把三条报告都纳入,平均是0.095,即二百分之十九。计算有三条记录,却仍只有两个事件结果。这个范围与两项首次报告平均不同,不能无说明当作同一个成绩。

相同事件范围里比较报告套组

上一章二十对象示例中,较低组十项有两项成立,较高组十项有八项成立。第一套全部报告二分之一,每项损失四分之一,因此平均为0.25。

第二套低组报五分之一,高组报五分之四。低组两项成立各损失0.64、八项未成立各损失0.04,共1.6;高组对应损失也合计1.6。全体平均3.2除以二十,为0.16。

第三套将两组报告反转,低组两项成立各损失0.04、八项未成立各损失0.64,共5.2;高组同样合计5.2,全体平均0.52。三套在同一事件与结果范围比较,尺度和分母相同。

第二套这次平均更小,既保留了程度,也对应示例中的条件区别。但一次有限套组的排序不是未来永久排序。校准页仍有用途:它显示各概率组怎样对应,而平均分只给一项汇总。

好看的平均可能省掉局部问题

一个批次中,大量简单对象分值很小,少量困难对象分值较大,全体平均仍可能不错。如果工作最需要判断困难对象,只给全体平均就未必回答使用者的问题。

可以保留整体成绩,同时按事前有理由区分的任务子组查看。子组少时也说明数量,不因出现较差分值就马上宣布发现稳定缺陷,更不凭事后任意切组给自己挑出最有利范围。

评分与校准因此可以并用。平均评分帮助比较同一范围内的报告,校准与条件诊断帮助看见对应结构;它们都需要账本的对象与版本,而不是相互替代全部检查。

如果某个子组并不属于原评价用途,排除可以合理,但要写明原因并保持一致。排除不宜由已知分值决定,否则评价范围就在事后改变了。

漏掉未决与错误会改变分母

L03尚未裁决,不应现在给它平方差;但它仍在已发出清单中。汇总可以说当前两项首次报告可评分、一项事前报告待决,不能只说本批共两项而让第三项消失。

如果结果材料缺失,记录错误或事件定义不清,也可以暂不评分,分别说明理由。不可评分的行保留为流程检查材料,不需要强行补一个结果让平均完整。

若较大损失的对象更容易被归为异常而删去,分母变化就直接影响成绩。应先看异常是否确有对应目标或材料理由,而不是以“这次不典型”替高分值寻找退出位置。

后来待决结束或结果更正,平均可以变化。变化可能来自新增裁决,不等于模型新运行。汇总版本标明来路,使读者看到同一批次何时具备哪些输入。

已知结果的报告不能混进事前成绩

L04在充分成立材料已取得后写下肯定状态一,按平方差可得零。这个算式没有错,任务位置却与未知结果时的预测不同。

若大量加入这样的陈述,平均会更小,但它主要说明已知材料被正确复述,不说明未知时点的概率判断更好。形式上同为p与Y,不代表任务相同。

评价页应按事前说明的任务范围区分。若目的本来是知识状态表达,也可另行检查L04;只是不能让它的零分替L01至L03的事前预测取得能力证明。

同样,离截止很近且已取得更多材料的预测,与早期预测混合时,应说明时距与信息范围。版本规则清楚以后,分数才有可以比较的位置。

只奖肯定结果会改变报告理由

设一种独立的错误规则:事件成立时奖励报告的肯定概率p,未成立时不奖励也不扣除。若记录者判断成立概率为q,其期望奖励为q乘p。

只要q大于零,按这项规则追求期望奖励就会偏向报一,而不是按q报告。即使q只有四分之一,报一仍比报四分之一得到更高期望奖励。

这不需要推定任何人物故意夸大。规则在数学上给了改报的理由,实际人怎样行动还需其他条件。我们先看见,称为评分的数字不一定鼓励报告真实程度。

若工作只表彰成立时大胆肯定,却把未成立的记录忘掉,也可能在记录结构中接近这种单边奖励。具体是否如此应查评价规则与完整账本,不能仅凭某人说话自信就作判断。

按结果加倍不是普通尺度调整

再设一个思想实验,给定q=二分之一,却将成立结果的平方损失乘二,未成立结果仍按原值。此时期望损失是(1-p)²+二分之一乘p²。

报告二分之一,期望损失为八分之三;报告三分之二,期望损失为三分之一,反而较小。这个改变不再让q本身成为最优报告,所以不能只说加重某项损失仍保留原诚实性质。

它与把全部分数统一乘二不同。统一倍数只改尺度,按结果改变倍数则改了两种可能结果之间的比较。使用不同权重时,要重新检查到底在评价什么。

行动中某种错误可能确实更昂贵,但行动损失与概率报告评分不是同一对象。可以认真讨论不同代价,却不能未经说明将代价权重塞进评分,再说新分数仍衡量同一种概率程度。

权重与排名的目的需要说明

不同任务对工作的重要性可能不同。若在结果未知前就给每项固定权重,并明确评价的是加权任务范围,汇总可以按该范围进行。权重来路应保留,不由成绩决定。

它也会影响使用者看到的整体表现。某类任务权重大,整体更代表这类任务;这不必是错误,但不能仍说平均代表每项同等的总体。

若权重随报告、结果或事后偏好改变,还要进一步检查规则性质。不能因为单项平方差是严格适当,就认为任意汇总与奖励程序都继承相同性质。

尤其在只关心排名而不关心期望损失时,参与者的目标又可能不同。本章不推导竞赛策略,只保留边界:标准规则的期望性质,不能无条件担保所有排名制度下的报告行为。

为了成绩挑任务会改变所称能力

记录者若只接受容易判断的对象,可能得到较小平均分。这样的成绩可以描述其实际任务,但不能无声扩为对所有接洽的判断能力。

如果前后任务范围改变,应保存批次与进入规则。平均改善可能来自材料更明确,也可能来自模型改进,不能仅由分值下降就决定是哪一种。

一个合理的工作范围可以明确收缩,不必为证明能力承接所有问题。只是收缩以后,结论也应跟着收缩:在这些任务上如何,而不是把排除的困难任务写成已经解决。

评价的范围完整性与评分公式同样重要。算式正确只能证明对给定输入算得对,不能证明输入没有经过有利选择。连续账本让这项检查有返回位置。

比较基准也需要发出时点

看到平均0.16,读者可能问这是否已经很好。一个单独数没有替我们选定比较对象。可以与同一任务范围中的另一套事前报告比较,也可以与一套明确的简单基准比较,但基准的来路需要说明。

例如上一章全部报告二分之一的套组,是思想实验里预先给定的一套报告,因此可以在相同结果上计算。如果在真实工作中,看完某批结果才用该批成立频率设定常数,再说它是原来就有的预测基准,便借用了后来材料。

回算基准仍可能有诊断用途。它帮助观察一套复杂报告与事后常数相比怎样,只是不能被写成一个当时可用、真正发出的竞争预测。若准备以后采用常数,则应保存其形成批次与后续发出位置。

比较还要保持相应对象。另一套模型若没有回答某些困难任务,不能直接拿较小平均与覆盖全部对象的模型排名;可以先在共同范围比较,同时报告各自未覆盖部分。共同范围的结论也不代表全部范围。

从分值返回一条原记录

顾宁设想读者看到某项0.5625后,能够回到报告四分之三、结果未成立的配对,再找到当时材料与裁决依据。这样分数不是唯一留下的记忆,而是返回判断的一条入口。

若只能找到分数却找不到原概率,也可能存在多个相应配对。二选平方差对不同报告与结果会给出相同值,单靠分数无法恢复全部内容。保存原输入仍是必要关系。

因此,汇总页可以简明,明细页却应能连接原报告与结果。发现某项计算错误时,可以更正算式;发现结果裁决错误时,另记裁决更正。两种变化都影响分值,但不应混称为预测模型改善。

评分不说明是谁造成了结果

唐可问,若附句流程以后带来更低分,是否说明它使确认增加?顾宁提醒,概率成绩与流程效果仍是两项问题。报告更贴合结果,不等于某个动作改变了结果。

一个新线索可能改善预测,却不参与造成目标;一个动作也可能影响目标而使任务结构改变。需要回到第十五、十六章的竞争解释与比较条件,不能用评分替因果判断。

评分同样不决定是否值得承接。一个较高概率可能面对不可承担的后果,一个较低概率也可能对应可接受的小步尝试。分值评价表征,行动还需目标、约束与失败路径。

本册因此把分数放在判断页。它帮助比较报告程度,不替站方决定投入设备、接收委托或选择退出时点。清楚的分工使下册能接手实际问题,而不是接到一个被当作万能结论的平均分。

得到较差分值后问具体缺口

若某次损失较大,可以先核查事件、报告版本与结果裁决是否准确,再看采用依据。原概率有支持但实现不利,与原材料重复计数,是不同的检查结果。

若多次在某类条件下损失较大,可以结合校准页查看方向与数量,并保留竞争解释。平均分提出问题,不独自说明该改哪一个输入,更不保证每次降低旧批次分值的修改都能改善新批次。

旧结果可以帮助形成候选规则,新规则仍需后续检查。把原报告事后改成贴近结果,可以降低回算分数,却不改善原来实际发出的预测成绩。

因此,改进页应写模型或流程将怎样改变,而不是只写下一次要得更低分。分数是反馈的一种表征,具体修改需要回到材料与适用条件。

给评分留下可以受约束的位置

在RC 的内部立场中,评分也是为明确任务截取的表征。它有严格的数学关系,也有有限的使用范围;内部一致不替外部对象、材料与裁决取得真实性。

我们可以明确采用平方差,准确保存较差成绩,同时保留解释尚未充分的位置。有限性不允许删掉已知反面结果,也不要求每次得分后立刻完成全部原因说明。

反馈若让原报告与实际结果相接,可以促进校准;若只奖励好看成绩、改写原数或选择输入,则可能使既有解释更加僵化。这个区别要查具体记录,不由评分名称授予。

一个可使用的评分页应说明尺度、方向、对象、版本、分母、权重及未决范围。读者看见一个数字时,能找到相应任务,而不是将数字当作记录者全部能力的替身。

二十点保存评分约定

周四二十点,顾宁保存本书的评分约定:二选肯定概率平方差,较小为好,平均按明确记录范围计算。首次报告与更新评价分开,已知结果陈述不混入相应事前成绩,未决与更正有持续位置。

L账本与二十对象演算作为独立方法示例保留,不算澄湾统计。R17仍没有最终概率与完整确认配对,候选四分之三不因公式已经写好而进入正式成绩,附句流程也未实施。

下一章将继续检查反面材料怎样使判断收缩。一次较差结果、多次分组偏离与明确材料错误并不是同一信号;修订需要说明它针对哪一层,而不只是对失败表现出更强的确信。