谁在拖垮供应商BOM数据的完整度?——基于29家供应商的非参数检验与回归分析

谁在拖垮供应商BOM数据的完整度?——基于29家供应商的非参数检验与回归分析

MinjieY Lv2

一、研究背景

针对 29 家上线供应商的 BOM(物料清单)数据,分析其数据完整度的影响因素。由于样本量较小且分布非正态,采用非参数检验方法为主,辅以多元线性回归与 Logistic 回归进行效应量化,探索影响数据完整性的关键因素。

二、数据说明

2.1 数据来源

数据来源于企业内部已上线的 29 家供应商 BOM 管理数字化系统,采集时点为系统上线初期一次性抽取,记录每家供应商在 BOM 系统中的字段填报情况。

2.2 字段定义

字段名 含义 取值类型 示例
已上线供应商名称 供应商企业全称 文本 柯锐世(上海)企业管理有限公司
BOM管理数字化系统品种 供应商使用的 BOM 系统类型 分类(QAD/SAP/INFOR 等) QAD
采集涉及几人参与 该供应商 BOM 数据采集过程参与人数 连续(1-4) 1
供货SKU数量 供应商供货的 SKU 总数 连续 6
产品复杂度(平均单SKU展开BOM条目) 单个 SKU 展开的平均 BOM 条目数 连续 5
SKU*BOM SKU 数量 × 平均 BOM 条目数,表征业务总复杂度 连续 30
收集完整度 16 列期望字段中实际填报的缺失情况 文本/有序 信息缺失3列,总16列

2.3 衍生变量

为便于统计建模,由「收集完整度」衍生出两个变量:

  • 完整度(连续):实际完整列数 / 期望列数(16),取值 0~1;
  • pass(二分类):0 = 缺失(存在信息缺失),1 = 合格(0 缺失);
  • 完整度分层(有序):1=优(0 缺失)、2=良(1-3 缺失)、3=中(4-6 缺失)、4=差(>6 缺失)。

2.4 数据示例

数据样例:

已上线供应商名称 BOM系统品种 采集人数 供货SKU数量 产品复杂度 SKU*BOM 收集完整度
XXX(上海)企业管理有限公司 QAD 1 6 5 30 信息缺失3列,总16列

2.5 样本结构

  • 样本量:N = 29 家供应商
  • 合格组:10 家(34.5%,0 缺失)
  • 缺失组:19 家(65.5%,存在 1-6 列缺失)
  • 采集人数分布:1 人 8 家、2 人 6 家、3 人 12 家、4 人 3 家
  • BOM 系统品种:SAP、QAD、INFOR 三类

2.6 分析思路

  1. 正态性检验 → 判断参数 / 非参数方法选择;
  2. 非参数组间差异检验(MWW、KW)→ 识别影响因素;
  3. Wilcoxon 符号秩检验 → 验证缺失的系统性;
  4. Spearman 相关 → 量化变量关系强度;
  5. 回归建模(线性、Logistic)→ 量化效应大小并控制混杂。

三、正态性检验

采用 Kolmogorov-Smirnov 与 Shapiro-Wilk 两种方法检验各变量的正态性。

K-S 统计量

S-W 统计量

变量 K-S 统计 K-S 自由度 K-S 显著性 S-W 统计 S-W 自由度 S-W 显著性
完整度 0.241 29 0.000 0.771 29 0.000
采集涉及几人参与 0.259 29 0.000 0.850 29 0.001
供货SKU数量 0.226 29 0.001 0.707 29 0.000
SKU*BOM 0.381 29 0.000 0.358 29 0.000
产品复杂度(平均单SKU展开BOM条目) 0.374 29 0.000 0.593 29 0.000

a. 里利氏显著性修正

结论:各变量均不服从正态分布(p<0.05),采用非参数方法合理。


四、Mann-Whitney U 检验(合格 vs 缺失)

Mann-Whitney U 检验用于比较两组独立样本的分布差异,统计量计算公式:

标准化检验统计量:

效应量:

4.1 秩统计

变量 PASS 个案数 秩平均值 秩的总和
采集涉及几人参与 0.00 19 19.42 369.00
1.00 10 6.60 66.00
总计 29
供货SKU数量 0.00 19 15.24 289.50
1.00 10 14.55 145.50
总计 29
产品复杂度(平均单SKU展开BOM条目) 0.00 19 13.68 260.00
1.00 10 17.50 175.00
总计 29
SKU*BOM 0.00 19 14.74 280.00
1.00 10 15.50 155.00
总计 29

产品复杂度秩差异大,预期不显著。

4.2 检验统计

指标 采集涉及几人参与 供货SKU数量 产品复杂度 SKU*BOM
曼-惠特尼 U 11.000 90.500 70.000 90.000
威尔科克森 W 66.000 145.500 260.000 280.000
Z -4.064 -0.206 -1.186 -0.229
渐近显著性(双尾) 0.000 0.836 0.236 0.819
精确显著性[2*(单尾显著性)] 0.000 0.839 0.266 0.839

a. 分组变量:pass b. 未针对绑定值进行修正。

解读:合格组人数显著更少,只有「采集人数」在合格/缺失组间有极显著差异(p<0.001,r=0.76,大效应),合格组人数明显更少。SKU 规模、产品复杂度、SKU*BOM 规模均无显著差异。


五、Mann-Whitney U 检验(采集人数低 vs 高)

5.1 秩统计

变量 采集人数分组 个案数 秩平均值 秩的总和
供货SKU数量 0.00 14 12.32 172.50
1.00 15 17.50 262.50
总计 29
产品复杂度(平均单SKU展开BOM条目) 0.00 14 14.61 204.50
1.00 15 15.37 230.50
总计 29
SKU*BOM 0.00 14 12.57 176.00
1.00 15 17.27 259.00
总计 29
完整度 0.00 14 20.46 286.50
1.00 15 9.90 148.50
总计 29

5.2 检验统计

指标 供货SKU数量 产品复杂度 SKU*BOM 完整度
曼-惠特尼 U 67.500 99.500 71.000 28.500
威尔科克森 W 172.500 204.500 176.000 148.500
Z -1.637 -0.248 -1.484 -3.429
渐近显著性(双尾) 0.102 0.804 0.138 0.001
精确显著性[2*(单尾显著性)] 0.102 0.813 0.146 0.000

a. 分组变量:采集人数分组 b. 未针对绑定值进行修正。

解读:低人数组(1-2 人)完整度秩平均 20.46,高人数组(3-4 人)仅 9.90,差距巨大,p=0.001,大效应量 r=0.64。参与采集人数越多,完整度反而越低


六、Wilcoxon 符号秩检验(配对)

验证「实际完整列数 vs 期望 16 列」是否存在系统性缺失。

Wilcoxon 符号秩检验统计量:

标准化检验统计量:

效应量:

分组:

  • 低人数组(1-2 人)
  • 高人数组(3-4 人)

6.1 秩统计

期望列数 - 实际列数 个案数 秩平均值 秩的总和
负秩 0 .00 .00
正秩 19 10.00 190.00
绑定值 0
总计 19
  • a. 期望列数 < 实际列数
  • b. 期望列数 > 实际列数
  • c. 期望列数 = 实际列数

说明

  • 负秩 0 个:没有供应商的实际列数 > 期望(即没人超完整)
  • 正秩 19 个:19 条供应商的期望列数 > 实际列数(即都缺了)
  • 绑定 0 个:没有「实际 = 期望」的(10 条合格的没进分析,因为差 = 0 自动剔除)
  • 正秩平均值 10.00,总和 190.00

6.2 检验统计

指标 期望列数 - 实际列数
Z -3.841
渐近显著性(双尾) 0.000

a. 威尔科克森符号秩检验 b. 基于负秩。

解读:实际完整列数显著低于期望 16 列(p<0.001,大效应 r=0.88),19 条供应商全部存在缺失,方向完全一致,存在系统性信息缺失,不是随机现象


七、Kruskal-Wallis H 检验(按采集人数分组)

按采集人数分组(1 / 2 / 3 / 4 人)。

Kruskal-Wallis H 检验统计量:

其中 为总样本量, 为分组数, 为第 组的秩和, 为第 组样本量。H 统计量服从自由度为 分布。

7.1 秩统计

变量 采集人数 个案数 秩平均值
完整度 1 8 22.25
2 6 18.08
3 12 10.25
4 3 8.50
总计 29
产品复杂度(平均单SKU展开BOM条目) 1 8 16.56
2 6 12.00
3 12 14.33
4 3 19.50
总计 29
SKU*BOM 1 8 15.50
2 6 8.67
3 12 16.83
4 3 19.00
总计 29
供货SKU数量 1 8 14.63
2 6 9.25
3 12 17.63
4 3 17.00
总计 29

从秩平均值看趋势,完整度按采集人数的秩平均:

采集人数 完整度秩平均
1 人 22.25(最高)
2 人 18.08
3 人 10.25
4 人 8.50(最低)

单调递减,即人数越多完整度越低。

7.2 检验统计

指标 完整度 产品复杂度 SKU*BOM 供货SKU数量
克鲁斯卡尔-沃利斯 H(K) 12.728 2.058 4.566 4.059
自由度 3 3 3 3
渐近显著性 0.005 0.560 0.207 0.255

a. 克鲁斯卡尔-沃利斯检验 b. 分组变量:采集涉及几人参与

解读:4 个采集人数组在完整度上有显著差异(H=12.73,p=0.005),且呈明显递减趋势:1 人组最高,4 人组最低。其他业务变量(SKU、复杂度、SKU*BOM)4 组间无差异。


八、Kruskal-Wallis 检验(按完整度分层分组)

值标签:1 = 优(0 缺失),2 = 良(1-3 缺失),3 = 中(4-6 缺失),4 = 差(>6 缺失)

8.1 秩统计

变量 完整度分层 个案数 秩平均值
产品复杂度(平均单SKU展开BOM条目) 1.00 10 17.50
2.00 9 11.67
3.00 7 14.29
4.00 3 18.33
总计 29
SKU*BOM 1.00 10 15.50
2.00 9 12.67
3.00 7 15.43
4.00 3 19.33
总计 29
供货SKU数量 1.00 10 14.55
2.00 9 13.22
3.00 7 16.86
4.00 3 17.50
总计 29
采集涉及几人参与 1.00 10 6.60
2.00 9 18.56
3.00 7 20.07
4.00 3 20.50
总计 29

采集人数按完整度分层的秩平均:

完整度分层 采集人数秩平均
优(0 缺失) 6.60(最低)
良(1-3 缺失) 18.56
中(4-6 缺失) 20.07
差(>6 缺失) 20.50(最高)

完整度越差,参与采集人数越多。

8.2 检验统计

指标 产品复杂度 SKU*BOM 供货SKU数量 采集涉及几人参与
克鲁斯卡尔-沃利斯 H(K) 2.939 1.505 1.012 16.721
自由度 3 3 3 3
渐近显著性 0.401 0.681 0.798 0.001

a. 克鲁斯卡尔-沃利斯检验 b. 分组变量:完整度分层


九、结论汇总

检验方法 对比 P 值 结论
MWW 合格 vs 缺失 <0.001 合格组人数更少
MWW 低人数 vs 高人数 0.001 低人数组完整度更高
KW 按人数 4 组 0.005 4 组完整度递减
KW 按完整度 4 层 0.001 分层人数递增

采集人数是影响数据完整度的唯一显著因素,且方向一致、影响关系明确。


十、Spearman 相关分析

Spearman 等级相关系数计算公式:

其中 为每对观测值在两个变量上的秩差, 为样本量。

10.1 相关系数矩阵

斯皮尔曼 RHO 完整度 采集涉及几人参与 供货SKU数量 产品复杂度 SKU*BOM
完整度相关系数 1.000 -0.662** -0.004 0.278 0.076
Sig.(双尾) . 0.000 0.982 0.145 0.697
N 29 29 29 29 29
采集涉及几人参与相关系数 -0.662** 1.000 0.210 0.034 0.191
Sig.(双尾) 0.000 . 0.275 0.861 0.321
N 29 29 29 29 29
供货SKU数量相关系数 -0.004 0.210 1.000 0.265 0.911**
Sig.(双尾) 0.982 0.275 . 0.165 0.000
N 29 29 29 29 29
产品复杂度相关系数 0.278 0.034 0.265 1.000 0.603**
Sig.(双尾) 0.145 0.861 0.165 . 0.001
N 29 29 29 29 29
SKU*BOM相关系数 0.076 0.191 0.911** 0.603** 1.000
Sig.(双尾) 0.697 0.321 0.000 0.001 .
N 29 29 29 29 29

**. 在 0.01 级别(双尾),相关性显著。

解读:采集人数与完整度显著相关(ρ=-0.662,p<0.001),人数越多完整度越低,中等强度负相关


十一、多元线性回归

  • 因变量:完整度
  • 自变量:参与采集人数、供货SKU数量、产品复杂度、SKU*BOM

多元线性回归模型:

代入回归系数:

完整度采集人数数量产品复杂度

决定系数:

11.1 系数表

模型 未标准化 B 未标准化标准错误 标准化 BETA T 显著性 共线性容差 VIF
(常量) 1.080 0.142 7.614 0.000
采集涉及几人参与 -0.269 0.053 -0.733 -5.120 0.000 0.950 1.053
供货SKU数量 0.001 0.001 0.175 0.746 0.463 0.354 2.821
SKU*BOM -5.263E-6 0.000 -0.281 -0.955 0.349 0.224 4.456
产品复杂度 0.001 0.001 0.226 1.113 0.277 0.474 2.108

a. 因变量:完整度

解读:多元线性回归分析显示模型整体显著(F=6.84,p=0.001),R²=0.533,4 个自变量可解释完整度 53.3% 的变异。

  • 采集人数是唯一显著的负向预测因子(B=-0.269,β=-0.733,t=-5.12,p<0.001),****每增加 1 人参与,完整度下降约 0.27
  • 供货SKU数量(p=0.463)、产品复杂度(p=0.277)、SKU*BOM(p=0.349)均不显著。
  • VIF 值均 <5,无严重多重共线性。

十二、Logistic 回归

  • 因变量:pass(合格=1,缺失=0)
  • 协变量:采集人数

Logistic 回归模型:

代入回归系数:

采集人数

数据合格概率:

采集人数

优势比(Odds Ratio):

12.1 方程中的变量

步骤 1 B 标准误差 瓦尔德 自由度 显著性 EXP(B) EXP(B) 95%CI 下限 EXP(B) 95%CI 上限
采集涉及几人参与 -2.966 1.037 8.174 1 0.004 0.052 0.007 0.393
常量 5.429 2.084 6.789 1 0.009 227.922

a. 在步骤 1 输入的变量:采集涉及几人参与。

模型评价

  • χ²=21.69,p<0.001
  • Nagelkerke R²=0.727
  • 预测准确率 86.2%

十三、综合结论解读

基于 29 家上线供应商数据的结果表明:

(1)数据非正态

所有变量均不服从正态分布,采用非参数检验方法合理。

(2)系统性缺失

Wilcoxon 符号秩检验确认实际完整列数显著低于期望 16 列(Z=-3.84,p<0.001),19 家供应商全部存在信息缺失,****存在系统性问题

(3)采集人数是唯一显著影响因素

五类非参数检验(MWW、KW、Wilcoxon、Spearman)和两类回归(线性、Logistic)结果高度一致:

  • MWW 显示合格组与缺失组在采集人数上差异极显著(U=11,p<0.001);
  • KW 显示按采集人数分 4 组,完整度呈单调递减(H=12.73,p=0.005);
  • Spearman 相关显示较强负相关(ρ=-0.662,p<0.001)。

(4)回归量化效应

  • 多元线性回归(R²=0.533)显示,控制 SKU 规模、产品复杂度、SKU*BOM 后,采集人数仍显著负向预测完整度(B=-0.269,β=-0.733,p<0.001),每增加 1 人参与,完整度下降约 0.27。
  • Logistic 回归(Nagelkerke R²=0.727,预测准确率 86.2%)显示,采集人数每增加 1 人,数据合格几率降至 5.2%(OR=0.052,95%CI: 0.007~0.393,p=0.004)。

(5)非显著因素

供货SKU数量、产品复杂度、SKU*BOM 业务总复杂度、BOM 系统品种在各检验中均无显著影响(p>0.1)。


十四、管理建议

供应商BOM数据采集的「人海战术」反而显著降低数据完整性,呈现明显的剂量-反应关系(1 人采集合格率 92.5% → 4 人采集合格率 1.7%)。但这一现象的根源​ 不在于采集人员的工作态度或个人意愿​,而在于企业内部的流程分工、职责划分等组织性因素。

关键认识

多人协作做表与一人拉通整表,​不是个人能力问题,而是组织协作问题​。协作本身是企业流程决定的,不可随意更改。因此,辨识出”多人协作质量较差”后,应进一步深挖协作过程中产生的问题,而非简单粗暴地建议”精简人员”或”专人负责制”。

改进建议:

  1. 统一标准​:协作各方使用统一的采集标准与字段定义,消除口径分歧;
  2. 统一培训​:所有协作人员接受同一套培训,确保理解一致;
  3. 集中时间与地点​:在有限的时间内、集中的地点,协作方共同完成数据采集工作;
  4. 同步对齐​:通过集中作业实时对齐进度与问题,减少信息差与遗漏。通过【统一标准 + 统一培训 + 集中作业】的方式,在保留多人协作组织模式的前提下,最大程度靠近一人完工的数据质量,从根本上提升 BOM 数据完整性。
  • 标题: 谁在拖垮供应商BOM数据的完整度?——基于29家供应商的非参数检验与回归分析
  • 创建于 : 2026-08-10 16:00:00
  • 更新于 : 2026-08-13 22:13:36
  • 链接: https://github.com/MinjieY/post/8a3c2e51.html
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
评论