基于 LRFMC 模型的航空公司客户 K-means 聚类分析

MinjieY Lv2

摘要

客户分类是企业整合营销资源、调整营销策略的重要依据。本文基于航空公司客户数据,使用 LRFMC 模型提取客户价值特征,并采用 K-means 聚类算法将客户划分为五个不同群体。通过对各客户群的特征分析,给出相应的营销策略建议,以期为航空公司向不同价值的客户提供个性化服务、制定针对性营销策略提供参考。

关键词:客户细分;数据挖掘;LRFMC 模型;K-means 聚类;航空公司;营销策略


一、研究背景

随着大数据时代的到来,聚类分析已成为研究消费者行为和特征的核心技术手段之一。传统的 RFM 模型主要从消费金额、消费频率和最近消费时间三个维度刻画客户价值,但在航空行业中,票价受运输距离、舱位等级等因素影响,单纯的消费金额难以全面反映客户价值。

因此,本文在传统 RFM 的基础上加入客户关系长度 L 和舱位折扣系数 C,构建 LRFMC 客户价值模型,并利用 K-means 聚类对航空客户进行分群,识别高价值客户、潜在价值客户、流失风险客户等不同类型,为精准营销提供支持。


二、LRFMC 指标体系

2.1 RFM 与 LRFMC 对比

模型 L R F M C
传统 RFM 模型 客户最近一次购买距今时间 一段时间内购买次数 一段时间内购买金额
航空公司 LRFMC 模型 会员入会时间距今月数 最近一次乘机距今月数 乘机次数 累计飞行里程 平均折扣系数

2.2 LRFMC 指标说明

指标 含义 计算方式
L 入会时间长度 LOAD_TIME - FFP_DATE(单位:月)
R 最近一次航班距今时间 LAST_TO_END
F 航班次数 FLIGHT_COUNT
M 航班里程 SEG_KM_SUM
C 航班折扣率 avg_discount

三、数据预处理

3.1 数据来源与规模

本研究使用某航空公司会员数据,原始数据共 62,988 条记录,经数据清洗后剩余 3,586 条有效记录用于聚类建模。

3.2 数据清洗

通过探索性分析发现,原始数据中存在票价为空值、票价为 0、折扣率为 0、飞行公里数大于 0 等异常记录。由于这部分数据占比较小,直接删除处理。年龄字段中存在的异常值(如大于 100)也通过条件过滤去除。

3.3 缺失值处理

对类别型数据(WORK_CITY、WORK_PROVINCE、WORK_COUNTRY、GENDER)和连续型数据(AGE)的缺失情况进行统计。AGE 采用均值填充,其他类别型字段因占比较小直接删除或视分析需要处理。

字段 空值数 空值比例
GENDER 3 4.76×10⁻⁵
WORK_CITY 2,268 0.0360
WORK_PROVINCE 3,244 0.0515
WORK_COUNTRY 25 3.97×10⁻⁴
AGE 420 0.00667
SUM_YR_1 551 0.00875
SUM_YR_2 138 0.00219

图表 2:缺失值可视化示意图

3.4 特征分布分析

对 LRFMC 五个特征进行箱线图和密度图分析,发现 F(航班次数)和 M(航班里程)存在较多异常值,说明这两个特征在客户群中分布较为分散,能够较好地区分客户。

图表 4:LRFMC 特征密度图

3.5 相关性分析

计算 LRFMC 五个特征之间的 Pearson 相关系数。F 与 M 的相关系数达到 0.83,呈强正相关;R 与 F、R 与 M 呈负相关;其余特征相关性较弱。

皮尔逊相关系数公式:

R F M C L
R 1 -0.48 -0.44 -0.36 -0.20
F -0.48 1 0.83 0.22 0.24
M -0.44 0.83 1 0.15 0.21
C -0.36 0.22 0.15 1 0.13
L -0.20 0.24 0.21 0.13 1

图表 5:LRFMC 特征 pairplot 与热力图

3.6 数据标准化

由于 K-means 聚类基于距离计算,各特征量纲不同,需对 LRFMC 五个指标进行标准化处理,消除量纲影响。


四、K-means 聚类建模

4.1 K-means 算法原理

K-means 是一种基于划分的无监督聚类算法,将 个样本划分为 个簇,使得簇内样本相似度尽可能高、簇间差异尽可能大。算法通过迭代更新簇中心,最小化误差平方和(SSE):

其中 为第 个簇, 为第 个质心, 为属于 的数据点。

4.2 聚类数确定

采用手肘法(Elbow Method)确定最佳聚类数。分析 时的 SSE 变化,当 时 SSE 下降明显减缓,因此选择 k=5

图表 6:不同聚类数对应的 SSE 折线图

4.3 聚类结果

使用 PySpark pyspark.ml.clustering 中的 KMeans 进行训练,聚类数 ,随机种子 seed=1。

各客户群样本数量:

客户群 样本数
Cluster 0 890
Cluster 1 944
Cluster 2 345
Cluster 3 706
Cluster 4 701
合计 3,586

标准化后的聚类中心:

客户群 R F M C L
Cluster 0 1.32 -0.58 -0.56 -0.96 -0.35
Cluster 1 -0.58 0.03 -0.01 0.23 1.12
Cluster 2 -0.92 2.36 2.39 0.44 0.48
Cluster 3 -0.01 -0.28 -0.31 1.26 -0.46
Cluster 4 -0.58 -0.14 -0.10 -0.48 -0.72

五、聚类结果分析

5.1 用户特征维度分析

客户特征分布图

图表 7:各客户群在 LRFMC 特征上的分布

  • R 特征:Cluster 0 的 R 值明显偏高,说明该类客户最近一次乘机时间较远,流失风险较高。
  • F、M 特征:Cluster 2 在 F、M 上存在极高异常点,分布偏态,说明其乘机频繁、飞行里程长,属于高价值客户。
  • C 特征:Cluster 3 的折扣系数较高,偏好折扣机票。
  • L 特征:Cluster 1 的 L 值偏大且集中,属于入会时间较长的老客户。

5.2 客户群维度分析

图表 8:五个客户群的 LRFMC 特征折线图

  • Cluster 0:R 值最大,其他特征较小,属于“重要挽留客户”。
  • Cluster 1:L 值最大,飞行频率高,属于“重要发展客户”。
  • Cluster 2:F、M 值最大,R 值最小,乘机频繁且近期活跃,属于“重要保持客户”。
  • Cluster 3:C 值最大,F、M 值较小,偏好折扣舱位,属于“低价值客户”。
  • Cluster 4:所有特征值均较小,入会时间短,属于“一般客户”。

5.3 客户价值排名

综合各客户群的特征表现,得到客户价值分类表:

客户群 客户价值排名 客户类型 特征说明
Cluster 2 1 重要保持客户 近期活跃、乘机频繁、里程长
Cluster 1 2 重要发展客户 入会时间长、飞行频率较高
Cluster 0 3 重要挽留客户 最近一次乘机时间久远
Cluster 4 4 一般客户 新入会、活跃度低
Cluster 3 5 低价值客户 偏好折扣票、消费贡献低

图表 9:客户价值分类结果


六、营销策略建议

6.1 会员等级管理

根据聚类结果,将客户划分为不同等级会员。达到一定飞行里程后可升级为核心会员,享受高级别服务;对接近升级标准的高消费客户,通过提示和促销活动刺激其完成升级。

6.2 积分兑换驱动

针对客户兑换积分积极性不高的问题,可通过积分购票折扣、首次兑换礼品等方式吸引客户,提升用户忠诚度和满意度。同时,对接近首次兑换标准但未达标的会员进行短信或电话提醒。

6.3 捆绑联名销售

通过与银行发行联名卡、话费充值送积分、与电商平台合作推出票务套餐等方式,增强客户粘性,扩大业务覆盖范围,提高客户忠诚度。


七、总结

本文基于 LRFMC 模型对航空公司客户价值进行了多维度刻画,并结合 K-means 聚类将客户划分为五个价值群体。相比传统 RFM 模型,LRFMC 加入了客户关系长度 L 和折扣系数 C,更适用于航空行业的客户特征分析。聚类结果表明:

  1. 重要保持客户(Cluster 2) 是最核心价值群体,应重点维护并提供差异化服务。
  2. 重要发展客户(Cluster 1) 具有较高成长潜力,应通过积分和优惠提升其粘性。
  3. 重要挽留客户(Cluster 0) 流失风险高,需及时采取召回措施。
  4. 一般客户(Cluster 4)低价值客户(Cluster 3) 可通过促销和等级激励逐步转化。

该方法为航空公司精准营销和客户关系管理提供了可行的数据驱动方案。

  • 标题: 基于 LRFMC 模型的航空公司客户 K-means 聚类分析
  • 创建于 : 2023-11-15 00:00:00
  • 更新于 : 2026-08-11 13:01:28
  • 链接: https://github.com/MinjieY/post/9c4a5d1b.html
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
评论