pandas大法好:轻松驾驭Excel,数据分析不再难!
liuian 2024-12-20 17:20 70 浏览
经常要捣鼓excel的小伙伴们,你们有福了,今天就来介绍下pandas这个强大、开源的数据分析处理工具,直接以“例”服人,没有多余废话,直接就能上手开干。也希望本文能够起到抛砖引玉的作用,让被excel表格处理缠身的你从此着迷pandas,掌握pandas大法可以从此让你高效工作,“人生苦短,我用pandas”。
安装pandas
本文的示例基于python3.12版本,首选需要安装pandas依赖库,还需要安装openpyxl以提供excel文件的支持,另外示例中还会展示简单的图表,这里使用的是plotly库,它可以生成交互式的图表。运行如下pip命令可以同时安装这三个依赖库。
pip install pandas openpyxl plotly
另外,强烈推荐使用jupyter notebook来运行文中的示例,如果你使用的是visual code编辑器也可以搜索安装jupyter插件直接在编辑器中开启jupyter,jupyter提供了一种交互式的方式来运行python代码,比如你需要读取一个非常大的excel文件,使用jupyter就只需读取一次,后续的代码就可以直接使用读取的数据而不必再次读取,而直接使用python代码方式运行就没有这个便利。如果你不清楚如何安装使用jupyter,建议网上搜索相关指导。
读取excel文件
首先需要说明pandas支持的远不止excel这一个类型,它可以读取和写入下图所示的多种类型的数据格式,这里重点以excel为例进行讲解。
pandas处理的数据类型主要是表格型数据,也就是包含行和列的二维数据,在pandas中称为DataFrame类型。
通过调用pandas的read_excel方法可以方便地读取excel文件的数据,并返回DataFrame数据类型,传入的参数为excel的文件路径
# 导入pandas模块,简写为pd
import pandas as pd
df = pd.read_excel('./data001.xlsx')
df
读取当前目录下的excel文件并显示表格数据,这里展示了jupyter文件的后缀和相关文件目录结构,后面将主要展示代码和数据部分。
接下来,我们就通过一个个具体的示例来演示pandas的具体使用。
数据的清洗与过滤
在工作中,很多时候你要处理的excel数据可能是来自他人提供的,或者通过各种渠道收集来的,出现数据字段缺失或错误是很常见的,规范整理这些数据需要花费大量的时间。pandas在数据清洗和过滤方面可谓得心应手,这里构造一份简单的人员信息的表格,其中有不少字段是空值。
通过pandas读取此excel信息并显示其中的数据,其中空值部分显示为NaN,表示为缺失数据。
dropna方法可以丢弃为空的数据,仅保留无缺失的记录
fillna方法可以为缺失数据提供默认值,比如这些员工信息只是漏填了某些字段,如果直接移除可能影响统计总数
isna方法可以检测某个单元格是否为空值,使用它可以方便地筛选出指定列缺失的数据,以及反数据
还可以指定其他的筛选条件,比如按照年龄大小
数据的分组与聚合
通过数据的清洗和过滤处理之后,就需要对数据进行统计分析和呈现了,重新构造一份学生成绩信息的excel表格数据来进行相关的演示。
结合groupby和count方法,按照姓名进行分组可以统计学生考试课程的数目,count对课程进行计数
结合groupby和mean方法,按照课程进行分组可以统计每门课程的平均分,mean对成绩一列求平均值
这里使用此数据绘制一个饼图来呈现课程平均分的占比,演示如何使用plotly绘制饼图
提示:使用plotly绘图如果遇到下面的报错信息,执行pip install nbformat,然后重启内核后重试
ValueError: Mime type rendering requires nbformat>=4.2.0 but it is not installed
结合groupby和sum方法,按照姓名进行分组可以统计学生的总分数,sum对成绩一列求和
这里使用此数据绘制一个直方图来呈现学生总分并降序排列,演示如何使用plotly绘制直方图
数据的合并
在数据的过滤和清洗示例中,我们给出了excel文件中瑕疵数据的各种处理手段,还可能存在一份完整的原始数据需要从很多表格中汇总的情况。再次构造两个包含员工的信息excel文件,仔细观察会发现两个表格中姓名和名字是相同的意思,其中一个表格还多了身高这一列,也就是说这两个表格数据并不完全一致,如果这样的表非常多,合并起来岂不是头大,说不定会边干活边爆粗口。
pandas可以轻松搞定这项工作,这里仅以两个表格为例进行演示,首先读取每个表格的数据,至于包含很多表格的情况,只需要使用循环读取即可。
接下来,首先需要做的就是把姓名和名字这两个字段名称统一,将名字改为姓名,然后使用pd.concat就可以把所有读取到的excel数据的列表进行合并了。合并结果如下,不包含身高信息的员工身高一列被填充为空,还需要强调的是合并的表格列名顺序不必一致,只要相同名称就可以正确合并,这就是pandas的强大之处。
输出excel文件
数据分析完了还需要把分析好的结果输出为excel文件,to_excel方法可以将DataFrame数据写入到excel文件中,传入参数为excel文件的路径。
比如前面得到的学生总分信息的数据可以直接写入excel文件
打开excel文件显示结果如下
参考文献
[1] https://pandas.pydata.org/
[2] https://plotly.com/python/
[3] 《利用Python进行数据分析 第2版》Wes McKinney著
相关推荐
- 赶紧收藏!编程python基础知识,本文给你全部整理好了
-
想一起学习编程Python的同学,趁我粉丝少,可以留言、私信领编程资料~Python基础入门既然学习Python,那么至少得了解下这门编程语言,知道Python代码执行过程吧。Python的历...
- 创建绩效改进计划 (PIP) 的6个步骤
-
每个经理都必须与未能达到期望的员工抗衡,也许他们的表现下降了,他们被分配了新的任务并且无法处理它们,或者他们处理了自己的任务,但他们的行为对他人造成了破坏。许多公司转向警告系统,然后在这些情况下终止。...
- PI3K/AKT信号通路全解析:核心分子、上游激活与下游效应分子
-
PI3K/AKT/mTOR(PAM)信号通路是真核细胞中高度保守的信号转导网络,作用于促进细胞存活、生长和细胞周期进程。PAM轴上生长因子向转录因子的信号传导受到与其他多条信号通路的多重交叉相互作用的...
- 互联网公司要求签PIP,裁员连N+1都没了?
-
2021年刚画上句号,令无数互联网公司从业者闻风丧胆的绩效公布时间就到了,脉脉上已然炸了锅。阿里3.25、腾讯二星、百度四挡、美团绩效C,虽然名称五花八门,实际上都代表了差绩效。拿到差绩效,非但不能晋...
- Python自动化办公应用学习笔记3—— pip工具安装
-
3.1pip工具安装最常用且最高效的Python第三方库安装方式是采用pip工具安装。pip是Python包管理工具,提供了对Python包的查找、下载、安装、卸载的功能。pip是Python官方提...
- 单片机都是相通的_单片机是串行还是并行
-
作为一个七年的从业者,单片机对于我个人而言它是一种可编程的器件,现在长见到的电子产品中几乎都有单片机的身影,它们是以单片机为核心,根据不同的功能需求,搭建不同的电路,从8位的单片机到32位的单片机,甚...
- STM32F0单片机快速入门八 聊聊 Coolie DMA
-
1.苦力DMA世上本没有路,走的人多了,便成了路。世上本没有DMA,需要搬运的数据多了,便有了DMA。大多数同学应该没有在项目中用过这个东西,因为一般情况下也真不需要这个东西。在早期的单片机中...
- 放弃51单片机,直接学习STM32开发可能会面临的问题
-
学习51单片机并非仅仅是为了学习51本身,而是通过它学习一种方法,即如何仅仅依靠Datasheet和例程来学习一种新的芯片。51单片机相对较简单,是这个过程中最容易上手的选择,而AVR单片机则更为复杂...
- STM32串口通信基本原理_stm32串口原理图
-
通信接口背景知识设备之间通信的方式一般情况下,设备之间的通信方式可以分成并行通信和串行通信两种。并行与串行通信的区别如下表所示。串行通信的分类1、按照数据传送方向,分为:单工:数据传输只支持数据在一个...
- 单片机的程序有多大?_单片机的程序有多大内存
-
之前一直很奇怪一个问题,每次写好单片机程序之后,用烧录软件进行烧录时,能看到烧录文件也就是hex的文件大小:我用的单片机芯片是STM32F103C8T6,程序储存器(flash)只有64K。从...
- 解析STM32单片机定时器编码器模式及其应用场景
-
本文将对STM32单片机定时器编码器模式进行详细解析,包括介绍不同的编码器模式、各自的优缺点以及相同点和不同点的应用场景。通过阅读本文,读者将对STM32单片机定时器编码器模式有全面的了解。一、引言...
- 两STM32单片机串口通讯实验_两个32单片机间串口通信
-
一、实验思路连接两个STM32单片机的串口引脚,单片机A进行发送,单片机B进行接收。单片机B根据接收到单片机A的指令来点亮或熄灭板载LED灯,通过实验现象来验证是否通讯成功。二、实验器材两套STM32...
- 基于单片机的智能考勤机设计_基于51单片机的指纹考勤机
-
一、设计背景随着科技水平的不断发展,在这么一个信息化的时代,智能化信息处理已是提高效率、规范管理和客观审查的最有效途径。近几年来,国内很多公司都在加强对企业人员的管理,考勤作为企业的基础管理,是公司...
- STM32单片机详细教学(二):STM32系列单片机的介绍
-
大家好,今天给大家介绍STM32系列单片机,文章末尾附有本毕业设计的论文和源码的获取方式,可进群免费领取。前言STM32系列芯片是为要求高性能、低成本、低功耗的嵌入式应用设计的ARMCortexM...
- STM32单片机的 Hard-Fault 硬件错误问题追踪与分析
-
有过单片机开发经验的人应该都会遇到过硬件错误(Hard-Fault)的问题,对于这样的问题,有些问题比较容易查找,有些就查找起来很麻烦,甚至可能很久都找不到问题到底是出在哪里。特别是有时候出现一次,后...
- 一周热门
-
-
【验证码逆向专栏】vaptcha 手势验证码逆向分析
-
Python实现人事自动打卡,再也不会被批评
-
Psutil + Flask + Pyecharts + Bootstrap 开发动态可视化系统监控
-
一个解决支持HTML/CSS/JS网页转PDF(高质量)的终极解决方案
-
再见Swagger UI 国人开源了一款超好用的 API 文档生成框架,真香
-
网页转成pdf文件的经验分享 网页转成pdf文件的经验分享怎么弄
-
C++ std::vector 简介
-
飞牛OS入门安装遇到问题,如何解决?
-
系统C盘清理:微信PC端文件清理,扩大C盘可用空间步骤
-
10款高性能NAS丨双十一必看,轻松搞定虚拟机、Docker、软路由
-
- 最近发表
- 标签列表
-
- python判断字典是否为空 (50)
- crontab每周一执行 (48)
- aes和des区别 (43)
- bash脚本和shell脚本的区别 (35)
- canvas库 (33)
- dataframe筛选满足条件的行 (35)
- gitlab日志 (33)
- lua xpcall (36)
- blob转json (33)
- python判断是否在列表中 (34)
- python html转pdf (36)
- 安装指定版本npm (37)
- idea搜索jar包内容 (33)
- css鼠标悬停出现隐藏的文字 (34)
- linux nacos启动命令 (33)
- gitlab 日志 (36)
- adb pull (37)
- python判断元素在不在列表里 (34)
- python 字典删除元素 (34)
- vscode切换git分支 (35)
- python bytes转16进制 (35)
- grep前后几行 (34)
- hashmap转list (35)
- c++ 字符串查找 (35)
- mysql刷新权限 (34)