526互联

SQL Server Analysis Services数据挖掘聚类分析职业、地区、餐饮消费水平数据|附代码数据

发布时间 2023-06-12 22:12:49作者: 拓端tecdat

全文链接：http://tecdat.cn/?p=31887

最近我们被客户要求撰写关于聚类的研究报告，包括一些图形和统计输出。

本文通过 SQL Server Analysis Services数据挖掘的分析模块，帮助客户对一个职业、地区、餐饮消费水平的数据挖掘，并用可视化分析图表显示数据

该结果可为餐饮业的管理者提供决策依据，进而使餐饮企业获得更多利润。同时，挖掘出与该职业相对应的地区及消费水平，可以为职业发展规划、餐饮市场的开拓提供有效依据。

准备工作：数据.xls 数据导入数据库中。

将表格命名

在相应数据库中找到对应的数据

商业智能项目

选择商业智能项目，analysis services项目，并选择目标文件夹

在解决方案资源管理器中，右键单击数据源，选择新建数据源

在解决方案资源管理器中，右键单击挖掘结构，选择新建挖掘结构

设置输入数据与键Id

设置训练集和测试集的百分比

点击部署模型

看到右下角部署完成

查看结果

从聚类结果可以看到，聚类将所有用户分成了2个聚类结果。

从不同类别的依赖图可以看到，类别10、4、8、6、7、5之间具有较强的相关关系。说明这几个类别中的变量特征是类似的。下面可以具体看下每个类别中的各个属性的分布的比例。

点击标题查阅往期内容

PYTHON用户流失数据挖掘：建立逻辑回归、XGBOOST、随机森林、决策树、支持向量机、朴素贝叶斯和KMEANS聚类用户画像

左右滑动查看更多

01

02

03

04

另外一个聚类中，1、2、9为一个聚类簇，说明这几类别中的变量特征类似。

同时可以看到每个变量再每个类别中的分布情况

可以看到消费水平很低的样本主要分布在分类10中

从上图可以看到餐饮消费水平较高的类别是1，2,9类别中。

下面可以看到各个分类的剖面图

可以看到每个分类中各个level所占的比例。西餐主要分布在分类1、2中。拍档主要分布在分类6、10中。

年龄的分布也非常明显。大多数分布在26岁左右，分类10的样本年龄最大。同时可以看到分类1 和9 的收入最高，同时他们常去的餐厅类型为西餐。同时可以看到所在城市在分类3中主要是通辽和根河市。他们主要去的餐厅类型是中餐和排档。在分类9中，可以看到医生职业的样本主要去的也是中餐类型。分类1中可以看到，去西餐的样本主要是少了的医生。

然后可以看到总体的分类特征。最常去的餐厅类型为中餐，其次是西餐。年收入最多的区间是51900到67000之间。餐饮消费在10元到18元之间。样本的主要年龄段在20岁到25岁。所在城市主要为根河市，其次是乌兰浩特。样本的职业中，最多的是客服专员。

从每个类别的倾向程度来看，分类1中，主要的样本区的是西餐餐厅。每次的消费在20到30元之间。年收入在8万到12万之间，说明这些样本的收入较高。其中，行政主管所占的百分比较高。有少量的创意总监。

从每个类别的倾向程度来看，分类1中，主要的样本区的是西餐餐厅。他们所在的城市主要在鄂尔多斯。

从每个类别的倾向程度来看，分类3中，主要的样本收入在3万3到3万6之间。他们的职业主要是文案策划，常去的餐厅为非西餐餐厅。

从每个类别的倾向程度来看，分类4中，主要的样本区的是中餐餐厅。主要的职业为市场总监。

从每个类别的倾向程度来看，分类5中，主要的样本区的是中餐餐厅。主要的职业为电工和电话销售以及教师。

从每个类别的倾向程度来看，分类6中，主要的样本去的是排挡餐厅。主要的职业为学生和服务员及会计师。该群体大部分收入较低或者没有收入。因此每次的餐厅消费也较低。

点击文末 “阅读原文”

获取全文完整代码数据资料。

本文选自《SQL Server Analysis Services数据挖掘聚类分析职业、地区、餐饮消费水平数据》。

点击标题查阅往期内容

Python对商店数据进行lstm和xgboost销售量时间序列建模预测分析
 PYTHON集成机器学习：用ADABOOST、决策树、逻辑回归集成模型分类和回归和网格搜索超参数优化
 R语言集成模型：提升树boosting、随机森林、约束最小二乘法加权平均模型融合分析时间序列数据
 Python对商店数据进行lstm和xgboost销售量时间序列建模预测分析
 R语言用主成分PCA、逻辑回归、决策树、随机森林分析心脏病数据并高维可视化
 R语言基于树的方法：决策树，随机森林，Bagging，增强树
 R语言用逻辑回归、决策树和随机森林对信贷数据集进行分类预测
 spss modeler用决策树神经网络预测ST的股票
 R语言中使用线性模型、回归决策树自动组合特征因子水平
 R语言中自编基尼系数的CART回归决策树的实现
 R语言用rle，svm和rpart决策树进行时间序列预测
 python在Scikit-learn中用决策树和随机森林预测NBA获胜者
 python中使用scikit-learn和pandas决策树进行iris鸢尾花数据分类建模和交叉验证
 R语言里的非线性模型：多项式回归、局部样条、平滑样条、广义相加模型GAM分析
 R语言用标准最小二乘OLS，广义相加模型GAM ，样条函数进行逻辑回归LOGISTIC分类
 R语言ISLR工资数据进行多项式回归和样条回归分析
 R语言中的多项式回归、局部回归、核平滑和平滑样条回归模型
 R语言用泊松Poisson回归、GAM样条曲线模型预测骑自行车者的数量
 R语言分位数回归、GAM样条曲线、指数平滑和SARIMA对电力负荷时间序列预测 R语言样条曲线、决策树、Adaboost、梯度提升(GBM)算法进行回归、分类和动态可视化
 如何用R语言在机器学习中建立集成模型？
R语言ARMA-EGARCH模型、集成预测算法对SPX实际波动率进行预测在python 深度学习Keras中计算神经网络集成模型 R语言ARIMA集成模型预测时间序列分析 R语言基于Bagging分类的逻辑回归(Logistic Regression)、决策树、森林分析心脏病患者
 R语言基于树的方法：决策树，随机森林，Bagging，增强树
 R语言基于Bootstrap的线性回归预测置信区间估计方法
 R语言使用bootstrap和增量法计算广义线性模型（GLM）预测置信区间
 R语言样条曲线、决策树、Adaboost、梯度提升(GBM)算法进行回归、分类和动态可视化
 Python对商店数据进行lstm和xgboost销售量时间序列建模预测分析
 R语言随机森林RandomForest、逻辑回归Logisitc预测心脏病数据和可视化分析
 R语言用主成分PCA、逻辑回归、决策树、随机森林分析心脏病数据并高维可视化
 Matlab建立SVM，KNN和朴素贝叶斯模型分类绘制ROC曲线
 matlab使用分位数随机森林（QRF）回归树检测异常值

数据购物网站analysis services

数据数据挖掘消费水平analysis

购物网站analysis services规则

reporting services数据库文件

数据表消费者数字专题

数据表消费者专题报告

白皮数据表白皮书消费者

数据表消费者趋势专题

线图highcharts水平数据

数据消费行为分析预测数据分析