数据中心 · 口径长文档

赛季数字怎么算

中欧体育主站公开的每一个数字,背后都有一份写死的口径。这份长文档把 2014 至 2024 赛季的采集、判定、统计与修订过程拆成 4 个章节组共 14 个章节,从赛季轴怎么分列,一路讲到发现不一致之后该走什么流程。

01

数字先落在哪个格子里

赛季与轮次两条轴线,决定了一条记录能不能被稳定定位,也决定了它能不能被别人复核。

CH.01

赛季轴与轮次轴分列

同一个赛季,从球队视角看和从轮次视角看,得到的东西并不一样。赛季轴把一支球队在某个赛季的全部记录串成一条线,用来观察它在漫长赛程里的起伏;轮次轴把同一轮的所有比赛并排放在一起,用来做同一时间点上的横向比较。两条轴在档案里同时存在,互为索引,指向的却是同一批赛事条目,因此不存在两套互相打架的数字。

查证时先确定自己要哪条轴,可以省掉大量翻找。想看一支球队三年内的阵容变化,走赛季轴;想看某一轮的判罚密度是否异常,走轮次轴。

小结先选轴,再检索,是这份档案最省时间的第一步。

CH.02

球队档案的编号与命名

累计收录 1,180 支球队档案。命名以该球队在对应赛季的官方注册名称为准,同一支球队在改制、更名或搬迁之后会产生新的档案条目,旧条目保留但标记为历史名称,检索时默认只返回当前赛季有效的名称,需要查历史名称可以在检索条件里显式打开。

编号与名称分离,是为了让阵容矩阵和跑动热区这两套数据能共用同一个球员编号体系。球队换名不影响编号,球员转会也不会让旧编号失效,只是在新赛季的条目里挂上新的归属关系。

小结查名称可能查不到,查编号一定查得到。

CH.03

一条赛事条目的字段构成

单场赛事条目含 140 余项字段,按用途分成四组。读者看到的通常只是其中几个数字,但任何一个数字要能被复核,都得靠同组的其他字段把边界说清楚。下表给出四组字段的项数与各自承担的作用,方便在遇到疑问时定位到正确的记录位置。

单场赛事条目的字段分组
字段组 项数 承担的作用
阵容与出场 42 记录首发、替补、换人时点与出场时长
判罚记录 31 记录越位、犯规、牌面及对应位置与依据
跑动与体能 28 记录全队与个人的跑动距离、区间与热区采样
赛程与场馆 39 记录轮次、开球时段、场地与赛事线归属

小结看到一个可疑数字,先判断它属于哪一组,再回原文核对同组字段。

CH.04

第 4 代档案结构改了什么

站点从单赛季联赛记录起步,随后依次补入杯赛签表、判罚档案与跑动核对,字段越加越多,早期按单一维度堆叠的做法开始出现检索困难。第 4 代档案结构把球队与轮次两条轴前置,把字段按用途分组,让阵容矩阵与跑动热区共用同一套球员编号,代价是部分历史条目的字段位置发生了移动。

移动只涉及排列顺序,不涉及数值本身。所有历史条目的原始数值保持原样,修订记录里会写明这次结构调整影响了哪些条目。

小结引用旧资料前,先确认它对应的是哪一代结构。

02

一次越位是怎么被记下来的

判罚档案是本页篇幅最长的一组。翻赛季档案越位次数的读者,多半就是卡在这一组里。

越位判定线与半透明色带交叠的抽象几何示意,无人物特写
图 01 判定线与划线依据的对应关系示意
CH.05

判罚从哪里开始记

记账起点是主裁判判罚生效的那一刻,不是视频助理裁判介入的时间,也不是转播画面切出划线图的时间。这样取的目的是让不同场次之间可以横向比较:所有记录都以同一类节点为锚,不会因为某场比赛的转播节奏不同而长短不一。

一次进攻中被判越位之后又发生二次判罚的,只记第一次生效的判罚,后续判罚作为附注写在同一条记录里,不新开条目。这让翻赛季档案越位次数时得到的次数与场次是对得上的。

小结次数统计的是生效判罚,不是划线次数。

CH.06

划线依据与位置标注

每条判罚都标注发生位置所在的前场区间与划线依据类型。位置标注采用相对区间而不是绝对坐标,原因是不同场馆的转播机位与画面比例差异较大,绝对坐标在不同场次之间无法直接对齐,区间标注则可以把同一类场景放在一起比较。

划线依据只记录判定所依赖的参考点类型,不记录逐帧画面的细节。这样做是为了让档案保持可复核,同时不把转播画面本身当作数据来源。

小结位置用于分组比较,依据用于说明判定来源。

CH.07

改判、撤销与原记录保留

判罚被改判或撤销时,原记录不删除,而是在同一条目上追加状态变更,并保留变更前的数值。读者在检索结果里默认看到的是变更后的最终值,切换到修订视图可以看到这条记录走过的每一步。

不删除原记录,是因为同一场比赛在不同时间被引用时,引用的可能是变更前的版本。保留全过程,才能解释两份看起来矛盾的资料为什么都曾经成立。

小结看到两份不一致的资料,先去修订视图里找它们各自的时间点。

CH.08

判罚字段的 31 项拆分

判罚记录共 31 项字段,可以粗略归为三类:判定类字段说明这次判罚为什么成立,位置类字段说明它发生在哪里,过程类字段说明它经过了几次变更。三类字段加起来 31 项,彼此之间不重复记录同一件事。

拆分到 31 项的代价是条目变长,好处是任何一次统计都可以沿着字段回溯到具体的判定动作,而不是停在一个汇总数字上。

小结31 项不是为了堆数量,而是为了让每个汇总数字都有出处。

03

距离是怎么量出来的

体育赛事场均跑动核对的读者最常问的是同一件事:为什么我看到的数值和这里不一样。

球场平面跑动热区与距离刻度叠合的对照图,青绿到紫色渐变
图 02 跑动热区与距离刻度的对照关系
CH.09

全队单场跑动区间的含义

全队单场跑动区间为 105 至 118 公里。这不是一条评分线,而是采集范围内实际出现过的高低边界:低于 105 公里和高于 118 公里的场次确实存在,但它们通常伴随人员不整、提前结束或极端天气等条件,单独成档,不混入常规区间。

做体育赛事场均跑动核对时,先确认比较对象落在哪一段。把一支球队的单个场次和区间两端直接对比,得到的结论往往站不住。

小结区间是描述,不是评价;用它做比较前先说清条件。

CH.10

人均跑动按位置分组

人均跑动区间为 10.4 至 11.6 公里,并按位置分组给出各自的区间。分组的意义在于:把门将和中场的跑动放在同一个平均数里,得到的是一个没有解释力的数字。分组之后,同一位置之间的比较才有意义,跨位置的比较则需要额外说明差异来源。

一个人的单场跑动会同时受位置、出场时长和比赛走势影响。核对时至少要把出场时长校准掉,否则替补登场的短时段记录会把整组的下限拉低。

小结先校准时长,再比位置,最后才下判断。

CH.11

热区采样与口径边界

热区图按固定网格采样,采样结果与距离数据来自同一批记录,因此两者之间不会出现互相矛盾的情况。需要说明的是,热区表达的是球员在场地各区域停留与通过的相对密度,不直接等同于跑动距离的分布。

热区图适合看活动范围,距离数据适合看总量。把两者混在一起解读,容易得出偏高的结论。

小结热区看范围,距离看总量,两者各司其职。

04

发现不一致之后

这套口径能成立,靠的是三级校验和一条写得清楚的勘误通路,而不是靠不出错。

CH.12

三级校验的先后次序

三级校验按固定次序执行:机器校验先跑一遍格式与取值范围,把明显越界的数值拦下来;双源交叉比对把同一场比赛的两份来源放在一起对,差异超过阈值的进入下一级;人工复核由人逐条判断,只处理前两级筛出来的记录。

次序不能颠倒。先人工再机器意味着大量时间花在本可以被规则拦住的记录上;先比对再查格式则会让格式错误污染比对结果。

小结三级不是三个并行检查,而是一条有先后的流水线。

CH.13

勘误提交与回填节奏

发现数值可疑时,通过站点客服邮箱提交,写清赛季、轮次、赛事条目与你认为正确的数值,并附上依据来源。收到之后先判断属于哪一级问题,再走对应的校验通道;确认属实的勘误在 2 个工作日内回填到档案里,回填同时更新该条目的修订记录。

无法确认的提交不会被直接改写数据,但会作为待观察项留在记录里,等同一问题再次出现时优先复核。这条通路的存在,是为了让外部反馈能真正进入校验流程,而不是停在一封邮件里。

小结写清条目和依据,勘误就能在 2 个工作日内落到档案上。

CH.14

来源标注与修订记录

每条档案记录都保留来源标注与修订记录。来源标注说明这条数据由哪类公开统计整理而来,修订记录说明它此后经历过哪些调整、每次调整发生在哪个版本代次。两者合在一起,让一个数字不只是一个数字,而是一段可以被追溯的过程。

引用本站数据时,请一并注明所依据的结构代次与读取时间,否则同一份资料在不同时期的引用会出现无法解释的差异。

小结能被追溯的数字,才算真正读懂了。

战术板与纸质记录并置的整理场景,冷白灯光,画面中无人脸
图 03 逐条复核时的比对现场

勘误通路

邮箱 service@league-zhongou.com.cn 是数据纠错与版权反馈的优先入口,工作日内提交的问题会先分级再处理,确认属实的内容 2 个工作日内完成回填。提交前请先核对本站结构代次,避免把版本差异当成数据错误。