订单数据分析:python操作案例分享
liuian 2025-05-02 11:47 21 浏览
在数据分析中,相对于excel的简单易用,python的学习门槛比较高。但在面对数据量大(比如超过100W行)、多数据源/表、复杂数据处理的情况下,python的优势就非常明显了。
前面“数据分析方法论”一文有提到数据分析的三个大步骤:是什么、为什么、怎么样。今天继续以电商领域的订单数据为例,结合分析步骤,分享一点python操作过程。
在开始分析前,我们需要先完成两个前提步骤:数据获取、数据处理。
【数据获取】
数据获取的情景,通常是这样的:收到数据库处理同学发的一份压缩文件包,里面有多层文件夹及多个文件;我们需要快速、自动化地读取文件包里的文件,并合并成一张表。
1、首先导入需要的函数包
import os
import pandas as pd
import numpy as np
import matplotlib.pyplot as plt
2、解压文件包后,获取文件包根目录地址
path = "C:\\Users\\project_data"
3、读取文件包里的所有文件
files = os.listdir(path)
4、创建一个空列表
final_data = pd.DataFrame()
5、自定义一个函数,可以逐层读取文件夹及文件,并把读取到的多个列表文件合并成一个
def get_all_files(path):
# 声明final_data是全局变量,使自定义函数也能调用
global final_data
files = os.listdir(path)
# 遍历第一层文件夹里的文件
for file in files:
# 如果file是文件,就获取文件名和扩展名,并读取文件内容
if os.path.isfile(path + "\\" + file):
filename,extension = os.path.splitext(file)
if extension == ".txt":
data = pd.read_table(path + "\\" + file)
print(data)
elif extension == ".xlsx":
data = pd.read_excel(path + "\\" + file)
print(data)
elif extension == ".csv":
file_data = pd.read_csv(path + "\\" + file)
# 把读取到的每个csv文件数据都加到final_data里,重新排列索引
final_data = final_data.append(file_data,ignore_index=True)
print(file + ".......合并中")
# 如果file是文件夹,就调用函数自己,重新遍历
if os.path.isdir(path + "\\" + file):
get_all_files(path + "\\" + file)
get_all_files(path)
print('数据合并完成')
【数据处理】
假设我们拿到的订单数据是这样的:
处理需求一:其中“订单状态”列有已取消、已完成、待发货、待支付、待收货五个值,后面分析只针对有效订单,所以需要把“已取消”的数据剔除。
data_clean = data[data["订单状态"]!="已取消"]
处理需求二:时间是电商订单分析的一个重要维度,当前的两列时间数据格式都是年-月-日 时-分-秒并在一起,需要把每个时间单位单个提取出来。本次案例只针对“时”进行分析。
data_clean["下单时段"] = data_clean["下单时间"].dt.hour
注:数据处理只是告一段落,随着数据分析需求的新增或调整,数据处理会不断插入进来。
【数据分析】
一、是什么:描述当前的核心指标状态
有效订单量:data_clean.shape
总营收:round(sum(data_clean["商品价格"]),2)
客单价:round(sum(data_clean["商品价格"])/((data_clean.shape[0]),2)
二、为什么:罗列可能原因的维度,当现状出现偏差时,下钻查看相关维度的哪个节点出现了问题。这里我们以时间维度中的“时”为例来展示下python代码:
1、以下单时段的24小时进行分组,获得每个小时的订单量
hour_count = data_clean.groupby("下单时段")["商品编号"].count().reset_index().rename(columns={"商品编号":"订单数量"})
2、把有效订单数/24得出平均每个小时的有效订单数为680,以680暂作为每个小时的好坏标准值:
hour_count["时均订单数量"] = [680,680,680,680,680,680,680,680,680,680,680,680,680,680,680,680,680,680,680,680,680,680,680,680]
3、可视化展示有效订单数在时段维度上的分布情况:
plt.figure(figsize=(25,3))
plt.plot(hour_count["下单时段"],hour_count["订单数量"])
plt.plot(hour_count["下单时段"],hour_count["时均订单数量"])
plt.xticks(np.arange(0,23,step=1))
plt.show()
三、怎么样:预测未来变化趋势。假设我们拿到的每日数据在时段上的分布是基本稳定的,那么从上图也能总结出时段分布规律:下单时间按订单量高低可划分成两个时段——早上十点至晚上十二点高订单量、凌晨一点至早上九点低订单量,其中晚上八点是高峰期。
相关推荐
- 使用Assembly打包和部署Spring Boot工程
-
SpringBoot项目的2种部署方式目前来说,SpringBoot项目有如下2种常见的部署方式一种是使用docker容器去部署。将SpringBoot的应用构建成一个docke...
- java高级用法之:调用本地方法的利器JNA
-
简介JAVA是可以调用本地方法的,官方提供的调用方式叫做JNI,全称叫做javanativeinterface。要想使用JNI,我们需要在JAVA代码中定义native方法,然后通过javah命令...
- Linux中如何通过Shell脚本来控制Spring Boot的Jar包启停服务?
-
SpringBoot项目在为开发者带来方便的同时,也带来了一个新的问题就是Jar包如何启动?在一般情况下我们都是采用了最为经典的java-jar命令来进行启动。然后通过ps命令找到对应的应用线程通...
- 牛逼!自己手写一个热加载(人民币手写符号一个横还是两个横)
-
热加载:在不停止程序运行的情况下,对类(对象)的动态替换JavaClassLoader简述Java中的类从被加载到内存中到卸载出内存为止,一共经历了七个阶段:加载、验证、准备、解析、初始化、使用、...
- java 错误: 找不到或无法加载主类?看看怎么解决吧!
-
问题扫述:项目名称调整,由原来的com.mp.qms.report.biz调整为com.mp.busicen.mec.qms.report.biz后。项目在IDEA直接运行,但打包部署到服务器...
- 如何将 Spring Boot 工程打包成独立的可执行 JAR 包
-
导语:通过将SpringBoot项目打包成独立的可执行JAR包,可以方便地在任何支持Java环境的机器上运行项目。本文将详细介绍如何通过Maven构建插件将SpringBoot...
- class 增量发包改造为 jar 包方式发布
-
大纲class增量发包介绍项目目录结构介绍jar包方式发布落地方案class增量发包介绍当前项目的迭代修复都是通过class增量包来发版本的将改动的代码class增量打包,如下图cla...
- Jar启动和IDE里启动Sprintboot的区别
-
想聊明白这个问题,需要补充一些前提条件,比如Fatjar、类加载机制等1、Fatjar我们在开发业务程序的时候,经常需要引用第三方的jar包,最终程序开发完成之后,通过打包程序,会把自己的代码和三...
- Java 20年,以后将往哪儿走?(java还能流行多久)
-
在今年的Java20周年的庆祝大会中,JavaOne2015的中心议题是“Java的20年”。甲骨文公司Java平台软件开发部的副总裁GeorgesSaab的主题演讲就将关注点放在了java...
- Spring Boot Jar 包秒变 Docker 镜像实现多环境部署
-
你是否在互联网大厂后端开发工作中,遇到过这样的困扰?当完成一个SpringBoot项目开发,准备将Jar包部署到不同环境时,却发现各个环境依赖不同、配置复杂,部署过程繁琐又容易出错,不仅耗费...
- 从0开始,让你的Spring Boot项目跑在Linux服务器
-
1搭建Linux服务器1.1购买阿里云服务器或安装虚拟机这里建议是CentOS7.X或CentOS8.X,当然其他的Linux如deepin、Ubuntu也可以,只是软件环境的安装包和安装方式...
- 【技术】Maven 上传第三方jar包到私服
-
通过nexus后台上传私服以NexusRepositoryManagerOSS2.14.5-02为例。登录nexus后台。定义Maven坐标Maven坐标有两种方式:1.自定义参数;2....
- JVM参数、main方法的args参数使用
-
一、前言我们知道JVM参数分为自定义参数、JVM系统参数,Javamain方法的参数。今天就谈谈怎么使用吧。二、查看jvm参数定义自定义参数我们打开cmd窗口,输入java,就能看到自定义参数的格式...
- Maven项目如何发布jar包到Nexus私服
-
Maven项目发布jar包到Nexus私服在编码过程中,有些通用的代码模块,有时候我们不想通过复制粘贴来粗暴地复用。因为这样不仅体现不了变化,也不利于统一管理。这里我们使用mavendeploy的方...
- 干货丨Hadoop安装步骤!详解各目录内容及作用
-
Hadoop是Apache基金会面向全球开源的产品之一,任何用户都可以从ApacheHadoop官网下载使用。今天,播妞将以编写时较为稳定的Hadoop2.7.4版本为例,详细讲解Hadoop的安...
- 一周热门
-
-
Python实现人事自动打卡,再也不会被批评
-
【验证码逆向专栏】vaptcha 手势验证码逆向分析
-
Psutil + Flask + Pyecharts + Bootstrap 开发动态可视化系统监控
-
一个解决支持HTML/CSS/JS网页转PDF(高质量)的终极解决方案
-
再见Swagger UI 国人开源了一款超好用的 API 文档生成框架,真香
-
网页转成pdf文件的经验分享 网页转成pdf文件的经验分享怎么弄
-
C++ std::vector 简介
-
系统C盘清理:微信PC端文件清理,扩大C盘可用空间步骤
-
10款高性能NAS丨双十一必看,轻松搞定虚拟机、Docker、软路由
-
python使用fitz模块提取pdf中的图片
-
- 最近发表
-
- 使用Assembly打包和部署Spring Boot工程
- java高级用法之:调用本地方法的利器JNA
- Linux中如何通过Shell脚本来控制Spring Boot的Jar包启停服务?
- 牛逼!自己手写一个热加载(人民币手写符号一个横还是两个横)
- java 错误: 找不到或无法加载主类?看看怎么解决吧!
- 如何将 Spring Boot 工程打包成独立的可执行 JAR 包
- class 增量发包改造为 jar 包方式发布
- Jar启动和IDE里启动Sprintboot的区别
- Java 20年,以后将往哪儿走?(java还能流行多久)
- Spring Boot Jar 包秒变 Docker 镜像实现多环境部署
- 标签列表
-
- python判断字典是否为空 (50)
- crontab每周一执行 (48)
- aes和des区别 (43)
- bash脚本和shell脚本的区别 (35)
- canvas库 (33)
- dataframe筛选满足条件的行 (35)
- gitlab日志 (33)
- lua xpcall (36)
- blob转json (33)
- python判断是否在列表中 (34)
- python html转pdf (36)
- 安装指定版本npm (37)
- idea搜索jar包内容 (33)
- css鼠标悬停出现隐藏的文字 (34)
- linux nacos启动命令 (33)
- gitlab 日志 (36)
- adb pull (37)
- table.render (33)
- python判断元素在不在列表里 (34)
- python 字典删除元素 (34)
- vscode切换git分支 (35)
- python bytes转16进制 (35)
- grep前后几行 (34)
- hashmap转list (35)
- c++ 字符串查找 (35)