谁在拖垮供应商BOM数据的完整度?——基于29家供应商的非参数检验与回归分析
一、研究背景
针对 29 家上线供应商的 BOM(物料清单)数据,分析其数据完整度的影响因素。由于样本量较小且分布非正态,采用非参数检验方法为主,辅以多元线性回归与 Logistic 回归进行效应量化,探索影响数据完整性的关键因素。
二、数据说明
2.1 数据来源
数据来源于企业内部已上线的 29 家供应商 BOM 管理数字化系统,采集时点为系统上线初期一次性抽取,记录每家供应商在 BOM 系统中的字段填报情况。
2.2 字段定义
| 字段名 | 含义 | 取值类型 | 示例 |
|---|---|---|---|
| 已上线供应商名称 | 供应商企业全称 | 文本 | 柯锐世(上海)企业管理有限公司 |
| BOM管理数字化系统品种 | 供应商使用的 BOM 系统类型 | 分类(QAD/SAP/INFOR 等) | QAD |
| 采集涉及几人参与 | 该供应商 BOM 数据采集过程参与人数 | 连续(1-4) | 1 |
| 供货SKU数量 | 供应商供货的 SKU 总数 | 连续 | 6 |
| 产品复杂度(平均单SKU展开BOM条目) | 单个 SKU 展开的平均 BOM 条目数 | 连续 | 5 |
| SKU*BOM | SKU 数量 × 平均 BOM 条目数,表征业务总复杂度 | 连续 | 30 |
| 收集完整度 | 16 列期望字段中实际填报的缺失情况 | 文本/有序 | 信息缺失3列,总16列 |
2.3 衍生变量
为便于统计建模,由「收集完整度」衍生出两个变量:
- 完整度(连续):实际完整列数 / 期望列数(16),取值 0~1;
- pass(二分类):0 = 缺失(存在信息缺失),1 = 合格(0 缺失);
- 完整度分层(有序):1=优(0 缺失)、2=良(1-3 缺失)、3=中(4-6 缺失)、4=差(>6 缺失)。
2.4 数据示例
数据样例:
| 已上线供应商名称 | BOM系统品种 | 采集人数 | 供货SKU数量 | 产品复杂度 | SKU*BOM | 收集完整度 |
|---|---|---|---|---|---|---|
| XXX(上海)企业管理有限公司 | QAD | 1 | 6 | 5 | 30 | 信息缺失3列,总16列 |
2.5 样本结构
- 样本量:N = 29 家供应商
- 合格组:10 家(34.5%,0 缺失)
- 缺失组:19 家(65.5%,存在 1-6 列缺失)
- 采集人数分布:1 人 8 家、2 人 6 家、3 人 12 家、4 人 3 家
- BOM 系统品种:SAP、QAD、INFOR 三类
2.6 分析思路
- 正态性检验 → 判断参数 / 非参数方法选择;
- 非参数组间差异检验(MWW、KW)→ 识别影响因素;
- Wilcoxon 符号秩检验 → 验证缺失的系统性;
- Spearman 相关 → 量化变量关系强度;
- 回归建模(线性、Logistic)→ 量化效应大小并控制混杂。
三、正态性检验
采用 Kolmogorov-Smirnov 与 Shapiro-Wilk 两种方法检验各变量的正态性。
K-S 统计量:
S-W 统计量:
| 变量 | K-S 统计 | K-S 自由度 | K-S 显著性 | S-W 统计 | S-W 自由度 | S-W 显著性 |
|---|---|---|---|---|---|---|
| 完整度 | 0.241 | 29 | 0.000 | 0.771 | 29 | 0.000 |
| 采集涉及几人参与 | 0.259 | 29 | 0.000 | 0.850 | 29 | 0.001 |
| 供货SKU数量 | 0.226 | 29 | 0.001 | 0.707 | 29 | 0.000 |
| SKU*BOM | 0.381 | 29 | 0.000 | 0.358 | 29 | 0.000 |
| 产品复杂度(平均单SKU展开BOM条目) | 0.374 | 29 | 0.000 | 0.593 | 29 | 0.000 |
a. 里利氏显著性修正
结论:各变量均不服从正态分布(p<0.05),采用非参数方法合理。
四、Mann-Whitney U 检验(合格 vs 缺失)
Mann-Whitney U 检验用于比较两组独立样本的分布差异,统计量计算公式:
标准化检验统计量:
效应量:
4.1 秩统计
| 变量 | PASS | 个案数 | 秩平均值 | 秩的总和 |
|---|---|---|---|---|
| 采集涉及几人参与 | 0.00 | 19 | 19.42 | 369.00 |
| 1.00 | 10 | 6.60 | 66.00 | |
| 总计 | 29 | |||
| 供货SKU数量 | 0.00 | 19 | 15.24 | 289.50 |
| 1.00 | 10 | 14.55 | 145.50 | |
| 总计 | 29 | |||
| 产品复杂度(平均单SKU展开BOM条目) | 0.00 | 19 | 13.68 | 260.00 |
| 1.00 | 10 | 17.50 | 175.00 | |
| 总计 | 29 | |||
| SKU*BOM | 0.00 | 19 | 14.74 | 280.00 |
| 1.00 | 10 | 15.50 | 155.00 | |
| 总计 | 29 |
产品复杂度秩差异大,预期不显著。
4.2 检验统计
| 指标 | 采集涉及几人参与 | 供货SKU数量 | 产品复杂度 | SKU*BOM |
|---|---|---|---|---|
| 曼-惠特尼 U | 11.000 | 90.500 | 70.000 | 90.000 |
| 威尔科克森 W | 66.000 | 145.500 | 260.000 | 280.000 |
| Z | -4.064 | -0.206 | -1.186 | -0.229 |
| 渐近显著性(双尾) | 0.000 | 0.836 | 0.236 | 0.819 |
| 精确显著性[2*(单尾显著性)] | 0.000 | 0.839 | 0.266 | 0.839 |
a. 分组变量:pass b. 未针对绑定值进行修正。
解读:合格组人数显著更少,只有「采集人数」在合格/缺失组间有极显著差异(p<0.001,r=0.76,大效应),合格组人数明显更少。SKU 规模、产品复杂度、SKU*BOM 规模均无显著差异。
五、Mann-Whitney U 检验(采集人数低 vs 高)
5.1 秩统计
| 变量 | 采集人数分组 | 个案数 | 秩平均值 | 秩的总和 |
|---|---|---|---|---|
| 供货SKU数量 | 0.00 | 14 | 12.32 | 172.50 |
| 1.00 | 15 | 17.50 | 262.50 | |
| 总计 | 29 | |||
| 产品复杂度(平均单SKU展开BOM条目) | 0.00 | 14 | 14.61 | 204.50 |
| 1.00 | 15 | 15.37 | 230.50 | |
| 总计 | 29 | |||
| SKU*BOM | 0.00 | 14 | 12.57 | 176.00 |
| 1.00 | 15 | 17.27 | 259.00 | |
| 总计 | 29 | |||
| 完整度 | 0.00 | 14 | 20.46 | 286.50 |
| 1.00 | 15 | 9.90 | 148.50 | |
| 总计 | 29 |
5.2 检验统计
| 指标 | 供货SKU数量 | 产品复杂度 | SKU*BOM | 完整度 |
|---|---|---|---|---|
| 曼-惠特尼 U | 67.500 | 99.500 | 71.000 | 28.500 |
| 威尔科克森 W | 172.500 | 204.500 | 176.000 | 148.500 |
| Z | -1.637 | -0.248 | -1.484 | -3.429 |
| 渐近显著性(双尾) | 0.102 | 0.804 | 0.138 | 0.001 |
| 精确显著性[2*(单尾显著性)] | 0.102 | 0.813 | 0.146 | 0.000 |
a. 分组变量:采集人数分组 b. 未针对绑定值进行修正。
解读:低人数组(1-2 人)完整度秩平均 20.46,高人数组(3-4 人)仅 9.90,差距巨大,p=0.001,大效应量 r=0.64。参与采集人数越多,完整度反而越低。
六、Wilcoxon 符号秩检验(配对)
验证「实际完整列数 vs 期望 16 列」是否存在系统性缺失。
Wilcoxon 符号秩检验统计量:
标准化检验统计量:
效应量:
分组:
- 低人数组(1-2 人)
- 高人数组(3-4 人)
6.1 秩统计
| 期望列数 - 实际列数 | 个案数 | 秩平均值 | 秩的总和 |
|---|---|---|---|
| 负秩 | 0 | .00 | .00 |
| 正秩 | 19 | 10.00 | 190.00 |
| 绑定值 | 0 | ||
| 总计 | 19 |
- a. 期望列数 < 实际列数
- b. 期望列数 > 实际列数
- c. 期望列数 = 实际列数
说明:
- 负秩 0 个:没有供应商的实际列数 > 期望(即没人超完整)
- 正秩 19 个:19 条供应商的期望列数 > 实际列数(即都缺了)
- 绑定 0 个:没有「实际 = 期望」的(10 条合格的没进分析,因为差 = 0 自动剔除)
- 正秩平均值 10.00,总和 190.00
6.2 检验统计
| 指标 | 期望列数 - 实际列数 |
|---|---|
| Z | -3.841 |
| 渐近显著性(双尾) | 0.000 |
a. 威尔科克森符号秩检验 b. 基于负秩。
解读:实际完整列数显著低于期望 16 列(p<0.001,大效应 r=0.88),19 条供应商全部存在缺失,方向完全一致,存在系统性信息缺失,不是随机现象。
七、Kruskal-Wallis H 检验(按采集人数分组)
按采集人数分组(1 / 2 / 3 / 4 人)。
Kruskal-Wallis H 检验统计量:
其中
7.1 秩统计
| 变量 | 采集人数 | 个案数 | 秩平均值 |
|---|---|---|---|
| 完整度 | 1 | 8 | 22.25 |
| 2 | 6 | 18.08 | |
| 3 | 12 | 10.25 | |
| 4 | 3 | 8.50 | |
| 总计 | 29 | ||
| 产品复杂度(平均单SKU展开BOM条目) | 1 | 8 | 16.56 |
| 2 | 6 | 12.00 | |
| 3 | 12 | 14.33 | |
| 4 | 3 | 19.50 | |
| 总计 | 29 | ||
| SKU*BOM | 1 | 8 | 15.50 |
| 2 | 6 | 8.67 | |
| 3 | 12 | 16.83 | |
| 4 | 3 | 19.00 | |
| 总计 | 29 | ||
| 供货SKU数量 | 1 | 8 | 14.63 |
| 2 | 6 | 9.25 | |
| 3 | 12 | 17.63 | |
| 4 | 3 | 17.00 | |
| 总计 | 29 |
从秩平均值看趋势,完整度按采集人数的秩平均:
| 采集人数 | 完整度秩平均 |
|---|---|
| 1 人 | 22.25(最高) |
| 2 人 | 18.08 |
| 3 人 | 10.25 |
| 4 人 | 8.50(最低) |
单调递减,即人数越多完整度越低。
7.2 检验统计
| 指标 | 完整度 | 产品复杂度 | SKU*BOM | 供货SKU数量 |
|---|---|---|---|---|
| 克鲁斯卡尔-沃利斯 H(K) | 12.728 | 2.058 | 4.566 | 4.059 |
| 自由度 | 3 | 3 | 3 | 3 |
| 渐近显著性 | 0.005 | 0.560 | 0.207 | 0.255 |
a. 克鲁斯卡尔-沃利斯检验 b. 分组变量:采集涉及几人参与
解读:4 个采集人数组在完整度上有显著差异(H=12.73,p=0.005),且呈明显递减趋势:1 人组最高,4 人组最低。其他业务变量(SKU、复杂度、SKU*BOM)4 组间无差异。
八、Kruskal-Wallis 检验(按完整度分层分组)
值标签:1 = 优(0 缺失),2 = 良(1-3 缺失),3 = 中(4-6 缺失),4 = 差(>6 缺失)
8.1 秩统计
| 变量 | 完整度分层 | 个案数 | 秩平均值 |
|---|---|---|---|
| 产品复杂度(平均单SKU展开BOM条目) | 1.00 | 10 | 17.50 |
| 2.00 | 9 | 11.67 | |
| 3.00 | 7 | 14.29 | |
| 4.00 | 3 | 18.33 | |
| 总计 | 29 | ||
| SKU*BOM | 1.00 | 10 | 15.50 |
| 2.00 | 9 | 12.67 | |
| 3.00 | 7 | 15.43 | |
| 4.00 | 3 | 19.33 | |
| 总计 | 29 | ||
| 供货SKU数量 | 1.00 | 10 | 14.55 |
| 2.00 | 9 | 13.22 | |
| 3.00 | 7 | 16.86 | |
| 4.00 | 3 | 17.50 | |
| 总计 | 29 | ||
| 采集涉及几人参与 | 1.00 | 10 | 6.60 |
| 2.00 | 9 | 18.56 | |
| 3.00 | 7 | 20.07 | |
| 4.00 | 3 | 20.50 | |
| 总计 | 29 |
采集人数按完整度分层的秩平均:
| 完整度分层 | 采集人数秩平均 |
|---|---|
| 优(0 缺失) | 6.60(最低) |
| 良(1-3 缺失) | 18.56 |
| 中(4-6 缺失) | 20.07 |
| 差(>6 缺失) | 20.50(最高) |
完整度越差,参与采集人数越多。
8.2 检验统计
| 指标 | 产品复杂度 | SKU*BOM | 供货SKU数量 | 采集涉及几人参与 |
|---|---|---|---|---|
| 克鲁斯卡尔-沃利斯 H(K) | 2.939 | 1.505 | 1.012 | 16.721 |
| 自由度 | 3 | 3 | 3 | 3 |
| 渐近显著性 | 0.401 | 0.681 | 0.798 | 0.001 |
a. 克鲁斯卡尔-沃利斯检验 b. 分组变量:完整度分层
九、结论汇总
| 检验方法 | 对比 | P 值 | 结论 |
|---|---|---|---|
| MWW | 合格 vs 缺失 | <0.001 | 合格组人数更少 |
| MWW | 低人数 vs 高人数 | 0.001 | 低人数组完整度更高 |
| KW | 按人数 4 组 | 0.005 | 4 组完整度递减 |
| KW | 按完整度 4 层 | 0.001 | 分层人数递增 |
采集人数是影响数据完整度的唯一显著因素,且方向一致、影响关系明确。
十、Spearman 相关分析
Spearman 等级相关系数计算公式:
其中
10.1 相关系数矩阵
| 斯皮尔曼 RHO | 完整度 | 采集涉及几人参与 | 供货SKU数量 | 产品复杂度 | SKU*BOM |
|---|---|---|---|---|---|
| 完整度相关系数 | 1.000 | -0.662** | -0.004 | 0.278 | 0.076 |
| Sig.(双尾) | . | 0.000 | 0.982 | 0.145 | 0.697 |
| N | 29 | 29 | 29 | 29 | 29 |
| 采集涉及几人参与相关系数 | -0.662** | 1.000 | 0.210 | 0.034 | 0.191 |
| Sig.(双尾) | 0.000 | . | 0.275 | 0.861 | 0.321 |
| N | 29 | 29 | 29 | 29 | 29 |
| 供货SKU数量相关系数 | -0.004 | 0.210 | 1.000 | 0.265 | 0.911** |
| Sig.(双尾) | 0.982 | 0.275 | . | 0.165 | 0.000 |
| N | 29 | 29 | 29 | 29 | 29 |
| 产品复杂度相关系数 | 0.278 | 0.034 | 0.265 | 1.000 | 0.603** |
| Sig.(双尾) | 0.145 | 0.861 | 0.165 | . | 0.001 |
| N | 29 | 29 | 29 | 29 | 29 |
| SKU*BOM相关系数 | 0.076 | 0.191 | 0.911** | 0.603** | 1.000 |
| Sig.(双尾) | 0.697 | 0.321 | 0.000 | 0.001 | . |
| N | 29 | 29 | 29 | 29 | 29 |
**. 在 0.01 级别(双尾),相关性显著。
解读:采集人数与完整度显著相关(ρ=-0.662,p<0.001),人数越多完整度越低,中等强度负相关。
十一、多元线性回归
- 因变量:完整度
- 自变量:参与采集人数、供货SKU数量、产品复杂度、SKU*BOM
多元线性回归模型:
代入回归系数:
决定系数:
11.1 系数表
| 模型 | 未标准化 B | 未标准化标准错误 | 标准化 BETA | T | 显著性 | 共线性容差 | VIF |
|---|---|---|---|---|---|---|---|
| (常量) | 1.080 | 0.142 | 7.614 | 0.000 | |||
| 采集涉及几人参与 | -0.269 | 0.053 | -0.733 | -5.120 | 0.000 | 0.950 | 1.053 |
| 供货SKU数量 | 0.001 | 0.001 | 0.175 | 0.746 | 0.463 | 0.354 | 2.821 |
| SKU*BOM | -5.263E-6 | 0.000 | -0.281 | -0.955 | 0.349 | 0.224 | 4.456 |
| 产品复杂度 | 0.001 | 0.001 | 0.226 | 1.113 | 0.277 | 0.474 | 2.108 |
a. 因变量:完整度
解读:多元线性回归分析显示模型整体显著(F=6.84,p=0.001),R²=0.533,4 个自变量可解释完整度 53.3% 的变异。
- 采集人数是唯一显著的负向预测因子(B=-0.269,β=-0.733,t=-5.12,p<0.001),****每增加 1 人参与,完整度下降约 0.27。
- 供货SKU数量(p=0.463)、产品复杂度(p=0.277)、SKU*BOM(p=0.349)均不显著。
- VIF 值均 <5,无严重多重共线性。
十二、Logistic 回归
- 因变量:pass(合格=1,缺失=0)
- 协变量:采集人数
Logistic 回归模型:
代入回归系数:
数据合格概率:
优势比(Odds Ratio):
12.1 方程中的变量
| 步骤 1 | B | 标准误差 | 瓦尔德 | 自由度 | 显著性 | EXP(B) | EXP(B) 95%CI 下限 | EXP(B) 95%CI 上限 |
|---|---|---|---|---|---|---|---|---|
| 采集涉及几人参与 | -2.966 | 1.037 | 8.174 | 1 | 0.004 | 0.052 | 0.007 | 0.393 |
| 常量 | 5.429 | 2.084 | 6.789 | 1 | 0.009 | 227.922 |
a. 在步骤 1 输入的变量:采集涉及几人参与。
模型评价:
- χ²=21.69,p<0.001
- Nagelkerke R²=0.727
- 预测准确率 86.2%
十三、综合结论解读
基于 29 家上线供应商数据的结果表明:
(1)数据非正态
所有变量均不服从正态分布,采用非参数检验方法合理。
(2)系统性缺失
Wilcoxon 符号秩检验确认实际完整列数显著低于期望 16 列(Z=-3.84,p<0.001),19 家供应商全部存在信息缺失,****存在系统性问题。
(3)采集人数是唯一显著影响因素
五类非参数检验(MWW、KW、Wilcoxon、Spearman)和两类回归(线性、Logistic)结果高度一致:
- MWW 显示合格组与缺失组在采集人数上差异极显著(U=11,p<0.001);
- KW 显示按采集人数分 4 组,完整度呈单调递减(H=12.73,p=0.005);
- Spearman 相关显示较强负相关(ρ=-0.662,p<0.001)。
(4)回归量化效应
- 多元线性回归(R²=0.533)显示,控制 SKU 规模、产品复杂度、SKU*BOM 后,采集人数仍显著负向预测完整度(B=-0.269,β=-0.733,p<0.001),每增加 1 人参与,完整度下降约 0.27。
- Logistic 回归(Nagelkerke R²=0.727,预测准确率 86.2%)显示,采集人数每增加 1 人,数据合格几率降至 5.2%(OR=0.052,95%CI: 0.007~0.393,p=0.004)。
(5)非显著因素
供货SKU数量、产品复杂度、SKU*BOM 业务总复杂度、BOM 系统品种在各检验中均无显著影响(p>0.1)。
十四、管理建议
供应商BOM数据采集的「人海战术」反而显著降低数据完整性,呈现明显的剂量-反应关系(1 人采集合格率 92.5% → 4 人采集合格率 1.7%)。但这一现象的根源 不在于采集人员的工作态度或个人意愿,而在于企业内部的流程分工、职责划分等组织性因素。
关键认识
多人协作做表与一人拉通整表,不是个人能力问题,而是组织协作问题。协作本身是企业流程决定的,不可随意更改。因此,辨识出”多人协作质量较差”后,应进一步深挖协作过程中产生的问题,而非简单粗暴地建议”精简人员”或”专人负责制”。
改进建议:
- 统一标准:协作各方使用统一的采集标准与字段定义,消除口径分歧;
- 统一培训:所有协作人员接受同一套培训,确保理解一致;
- 集中时间与地点:在有限的时间内、集中的地点,协作方共同完成数据采集工作;
- 同步对齐:通过集中作业实时对齐进度与问题,减少信息差与遗漏。通过【统一标准 + 统一培训 + 集中作业】的方式,在保留多人协作组织模式的前提下,最大程度靠近一人完工的数据质量,从根本上提升 BOM 数据完整性。
- 标题: 谁在拖垮供应商BOM数据的完整度?——基于29家供应商的非参数检验与回归分析
- 创建于 : 2026-08-10 16:00:00
- 更新于 : 2026-08-13 22:13:36
- 链接: https://github.com/MinjieY/post/8a3c2e51.html
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
