Python 数据转换踩坑实录:5 个项目中必遇的坑,附现成解决方案
liuian 2025-07-27 22:00 11 浏览
做数据处理的同学应该都懂:80% 的时间都耗在数据清洗上,而其中一半的麻烦都来自数据转换。明明看着简单的类型转换,一到实际项目里就各种报错,今天就把我踩过的坑和解决方案整理出来,新手看完直接抄作业!
一、字符串转数字:看似简单的 ValueError 陷阱
上周帮运营处理销售数据时,Excel 里的金额列明明是数字,读进 Python 里却变成了字符串。用 int () 转换时直接报错:ValueError: invalid literal for int() with base 10: '123.45'
问题根源:
- 字符串里藏着小数点(该转 float 却用了 int)
- 数字中间混有逗号(如 "1,234")
- 表面是数字实际含空格(如 "123")
解决方案:
写一个万能转换函数,先清洗再转换:
def str_to_num(s):
# 移除逗号和空格
s = s.replace(',', '').strip()
# 尝试转int,失败则转float
try:
return int(s)
except ValueError:
try:
return float(s)
except ValueError:
return None # 无法转换的返回空值
# 测试案例
print(str_to_num(" 1,234.56 ")) # 输出1234.56
二、日期格式混乱:从 "2023/12-31" 到标准时间的战斗
做用户行为分析时,遇到过最离谱的日期格式集合:"2023/12/31"、"31-12-2023"、"2023年12月31日"甚至"20231231"。用 pd.to_datetime () 直接批量转换?结果一半变成 NaT。
破局关键:
用 dateutil 库自动识别格式,配合异常捕获处理特殊值:
from dateutil import parser
import pandas as pd
def parse_date(s):
try:
# 自动识别大多数格式
return parser.parse(s)
except:
# 处理中文格式
if '年' in s:
return pd.to_datetime(s, format='%Y年%m月%d日')
# 处理纯数字格式
elif s.isdigit() and len(s) == 8:
return pd.to_datetime(s, format='%Y%m%d')
else:
return None
# 实战效果
dates = ["2023/12/31", "31-12-2023", "2023年12月31日", "20231231"]
print([parse_date(d) for d in dates]) # 全部转换成功
三、列表与字典互转:别让嵌套结构搞崩溃
爬取电商评论时,遇到过这种数据:"[{'id':1}, {'id':2}]"—— 看着是列表套字典,实际是字符串。直接用 list () 转换只会拆成单个字符,用 eval () 又怕有安全风险。
安全转换方案:
用 ast 库的 literal_eval (),比 eval () 更安全:
import ast
str_data = "[{'id':1}, {'id':2}]"
try:
# 安全解析字符串格式的列表/字典
data = ast.literal_eval(str_data)
print(type(data)) # 输出<class 'list'>
except SyntaxError:
print("格式错误,无法转换")
如果遇到更复杂的 JSON 字符串,记得用 json 库:
import json
json_str = '[{"id":1}, {"id":2}]'
data = json.loads(json_str) # 注意JSON里必须用双引号
四、数据类型不兼容:Pandas 里的 astype () 失效之谜
处理 DataFrame 时,经常遇到某列明明看着是数字,却无法用 astype (float) 转换,报错ValueError: could not convert string to float: '未知'。
背后原因:
列中混入了非数字值(如 "未知"、"N/A"),astype () 无法处理这种脏数据。
正确操作:
先用 to_numeric () 配合 errors 参数过滤异常值:
import pandas as pd
df = pd.DataFrame({'value': ['123', '45.6', '未知', '789']})
# 转换为数值,错误值转为NaN
df['value_num'] = pd.to_numeric(df['value'], errors='coerce')
# 填充缺失值(根据业务场景选择填充方式)
df['value_num'] = df['value_num'].fillna(0)
print(df['value_num'].dtype) # 输出float64
五、编码转换:从乱码 "é?éa 1/2 " 到正常中文
爬取境外网站时,最头疼的就是编码问题。明明指定了 utf-8,结果还是出现 "~A(c)^A^A?~A(c)^A^A~Ayen^A^A 1/2 " 这种乱码。
排查步骤:
- 先用 chardet 检测真实编码
- 再用正确编码重新解码
import chardet
# 检测编码
raw_data = b'\xc3\xa9\xc2\x98\xc2\x99\xc3\xa9\xc2\x87\xc2\x8c\xc3\xa5\xc2\x8d\xc2\x8e'
detect_result = chardet.detect(raw_data)
print(detect_result['encoding']) # 输出ISO-8859-1
# 正确解码
correct_text = raw_data.decode('ISO-8859-1').encode('latin-1').decode('utf-8')
print(correct_text) # 输出"阿里巴巴"
避坑总结:3 条黄金法则
- 转换前先检查:用 type () 查看数据类型,用 chardet 检测编码,用 value_counts () 看数据分布
- 永远用 try-except:批量转换时一定要加异常捕获,避免一条坏数据搞崩整个程序
- 优先用专业库:日期用 dateutil,JSON 用 json 库,少用 eval () 等危险操作
其实数据转换的核心不是死记函数,而是培养 "预判错误" 的思维。你在项目中还遇到过哪些奇葩的转换问题?评论区告诉我,下次专门出解决方案!
相关推荐
- 10种常见的MySQL错误,你可中招?
-
【51CTO.com快译】如果未能对MySQL8进行恰当的配置,您非但可能遇到无法顺利访问、或调用MySQL的窘境,而且还可能给真实的应用生产环境带来巨大的影响。本文列举了十种MySQL...
- MySQL主从如何保证数据一致性
-
MySQL主从(主备)搭建请点击基于Spring的数据库读写分离。MySQL主备基本原理假设主备切换前,我们的主库是节点A,节点B是节点A的备库,客户端的读写都是直接访问节点A,节点B只是将A的更新同...
- MySQL低版本升级操作流程
-
(关注“数据库架构师”公众号,提升数据库技能,助力职业发展)0-升级背景MySQL5.5发布于2010年,至今已有十年历史,官方已经停止更新。2008年发布的MySQL5.1版本,在2018年...
- MySQL数据库知识
-
MySQL是一种关系型数据库管理系统;那废话不多说,直接上自己以前学习整理文档:查看数据库命令:(1).查看存储过程状态:showprocedurestatus;(2).显示系统变量:show...
- Mysql 8.4数据库安装、新建用户和数据库、表单
-
1、下载MySQL数据库yuminstall-ywgetperlnet-toolslibtirpc#安装wget和perl、net-tools、libtirpcwgethtt...
- mysql8.0新功能介绍
-
MySQL8.0新特性集锦一、默认字符集由latin1变为utf8mb4在8.0版本之前,默认字符集为latin1,utf8指向的是utf8mb3,8.0版本默认字符集为utf8mb4,utf8默...
- 全网最详细解决Windows下Mysql数据库安装后忘记初始root 密码方法
-
一、准备重置root的初始化密码Win+R键启动命令输入窗口;输入cmd打开命令执行窗口;##界面如下##输入命令:netstopmysqld#此操作会停止当前运行的...
- 互联网大厂面试:MySQL使用grant授权后必须flush privilege吗
-
从我上大学时,数据库概论老师就告诉我,MySQL使用grant对用户授权之后,一定记得要用flushprivilege命令刷新缓存,这样才能使赋权命令生效。毕业工作以后,在很多的技术文档上,仍然可以...
- # mysql 8.0 版本无法使用 sqlyog 等图形界面 登录 的解决方法
-
30万以下的理想L6来了##mysql8.0版本无法使用sqlyog等图形界面登录的解决方法当我们在cmd下登录mysql时正常时,用sqlyog等图形界面连接数据库时却...
- MySQL触发器介绍
-
前言:在学习MySQL的过程中,可能你了解过触发器的概念,不清楚各位是否有详细的去学习过触发器,最近看了几篇关于触发器的文档,分享下MySQL触发器相关知识。1.触发器简介触发器即trigg...
- 管理员常用的MySQL命令汇总(一)
-
以下是管理员常用的MySQL命令:以管理员身份连接到MySQL:mysql-uroot-p创建新的MySQL用户:CREATEUSER'username'@'...
- Linux(CentOS) 在线安装MySQL8.0和其他版本,修改root密码
-
一:安装MySQL数据库1),下载并安装MySQL官方的YumRepositorymysql官方仓库地址:https://dev.mysql.com/downloads/repo/yum/选择自...
- 解决 MySQL 8.0 一直拒绝 root 登录问题
-
Accessdeniedforuser'root'@'localhost'(usingpassword:YES)这个错误在网上搜一下,能看到非常多的此类...
- 大模型MCP之MYSQL安装
-
前言学习大模型的时候需要一个mysql,原因还是在公司使用电脑的时候不允许按照Docker-Desktop,我的宿主机其实是MAC,我习惯上还是在centsos上面安装,就发现这件过去很简单的事情居然...
- MySQL ERROR 1396
-
ERROR1396(HY000):OperationCREATEUSERfailedfor'usera'@'%'问题描述mysql>create...
- 一周热门
-
-
Python实现人事自动打卡,再也不会被批评
-
【验证码逆向专栏】vaptcha 手势验证码逆向分析
-
Psutil + Flask + Pyecharts + Bootstrap 开发动态可视化系统监控
-
一个解决支持HTML/CSS/JS网页转PDF(高质量)的终极解决方案
-
再见Swagger UI 国人开源了一款超好用的 API 文档生成框架,真香
-
网页转成pdf文件的经验分享 网页转成pdf文件的经验分享怎么弄
-
C++ std::vector 简介
-
系统C盘清理:微信PC端文件清理,扩大C盘可用空间步骤
-
飞牛OS入门安装遇到问题,如何解决?
-
10款高性能NAS丨双十一必看,轻松搞定虚拟机、Docker、软路由
-
- 最近发表
- 标签列表
-
- python判断字典是否为空 (50)
- crontab每周一执行 (48)
- aes和des区别 (43)
- bash脚本和shell脚本的区别 (35)
- canvas库 (33)
- dataframe筛选满足条件的行 (35)
- gitlab日志 (33)
- lua xpcall (36)
- blob转json (33)
- python判断是否在列表中 (34)
- python html转pdf (36)
- 安装指定版本npm (37)
- idea搜索jar包内容 (33)
- css鼠标悬停出现隐藏的文字 (34)
- linux nacos启动命令 (33)
- gitlab 日志 (36)
- adb pull (37)
- python判断元素在不在列表里 (34)
- python 字典删除元素 (34)
- vscode切换git分支 (35)
- python bytes转16进制 (35)
- grep前后几行 (34)
- hashmap转list (35)
- c++ 字符串查找 (35)
- mysql刷新权限 (34)