百度360必应搜狗淘宝本站头条
当前位置:网站首页 > IT知识 > 正文

量化入门课:如何使用duckdb,轻松读取数据

liuian 2025-01-10 15:15 47 浏览

《量化入门课:如何免费获取期货数据?》一文中我们下载好了数据,打开的数据是csv格式的,csv是一种比较通用的数据格式,用途比较广泛,我们可以用文本编辑器或者excel、wps直接打开。 但是怎样从csv中读取数据呢?

入门的方案:pandas [1]

Pandas 是一个开源的 Python 数据分析和数据处理库,它为 Python 编程语言提供了强大的数据结构和分析工具,广泛用于数据挖掘、数据分析、数据可视化等领域。

通俗理解就是,pandas是一个python代码版的excel, 我们可以使用它轻松的做数据分析,例如筛选、汇总、均线、画图等等。

使用pandas如何读取数据呢?

import pandas as pd   
# 首先我们找到需要读取的csv文件路径  
path = r"C:\Users\jerri\Downloads\ricequant_data_1d\data\Future\1d\RB\RB99.csv"  
df = pd.read_csv(path)  # 读取csv文件到pandas里面  
df.head()  # 显示前5行数据

在实际的使用过程中,k线数据往往需要制定Date格式为索引,并且Date是日期格式, 所以读取的代码可以修改如下:

df = pd.read_csv(path, index_col='Date', parse_dates=True)  # 读取csv文件到pandas里面,指定date列为索引,并将其格式化为日期格式  
df.head()  # 显示前5行数据

插图-读取csv数据.png

现在问题来了,如果我们现在有很多文件需要读取, 而且每一个文件在不同的文件夹下面,怎么办呢? 例如在实际项目中我们面临这样的需求:读取每个品种的连续合约(文件名称99结尾),2024-01-01~现在的数据,放到一个dateframe中

如果继续说采用pandas读取的方式,我们需要筛选每一个符合条件的文件,然后读取全部数据,再筛选里面满足条件的数据,这样的方式显然比较繁琐。

有没有更优雅的方式呢?

进阶的方式:DuckDB[2]

DuckDB 是一个开源的、嵌入式的 SQL 关系数据库管理系统,旨在为数据分析提供高性能的查询执行。它被设计为类似于 SQLite,但特别针对分析工作负载进行了优化。

简单来说,我们就是可以把本地所有的csv文件当成一个数据库,然后使用duckdb编写sql语句来调用,这样明显的优雅多了。

duckdb 安装

pip install duckdb

使用duckdb读取csv文件

# 使用duckdb读取csv文件  
import duckdb  
path = r"C:\Users\jerri\Downloads\ricequant_data_1d\data\Future\1d\RB\RB99.csv"  
conn = duckdb.connect()  
sql = f"SELECT * FROM read_csv_auto('{path}')"  
df = conn.execute(sql).fetchdf()  
conn.close()  
df.head()  # 显示前5行数据

看起来并没有方便很多对吗?

现在我们来实现上面的复杂需求,结合glob库

import duckdb   
import glob  
paths = glob.glob(r"C:\Users\jerri\Downloads\ricequant_data_1d\data\Future\1d\RB\*.csv")  
conn = duckdb.connect()  
sql = f"SELECT * FROM read_csv({paths},filename=TRUE) WHERE DATE > '2024-01-01'"  
df = conn.execute(sql).fetchdf()  
conn.close()  
df.head()  # 显示前5行数据

核心代码两条就足够了,是不是简洁很多!

总结

  1. 如果是读取一个或者少量的csv文件,我们直接使用pandas即可
  2. 如果是读取整个文件夹下,或者规则比较负责的csv,并且有一些其他附加条件,duckdb更方便

参考资料

[1] pandas : https://pandas.pydata.org/

[2] DuckDB: https://duckdb.org/docs/data/csv/overview

相关推荐

qualcomm无线网卡驱动(高科无线网卡驱动)

先找个这个,然后卸载驱动程序,然后在装驱动,如果安装不成功,就去官网找驱动,驱动精灵的有时候不行。1、检查网线是否插好首先,我们需要检查下网线是否插好了。如果网线插口没插好,电脑就无法检测到网络信号...

虚拟内存设置多少合适16g(虚拟内存数值设置多少合适)

16g内存虚拟内存要调到24576MB才合适。虚拟内存的设置大小一般是物理内存的1.5倍,16G的内存可以考虑调整为24576MB。如果只用于办公方面,那么运行内存大于或等于4G,不用设置虚拟内存。如...

系统光盘镜像下载(系统光盘镜像文件转换到u盘)

要在虚拟机中使用映像文件,需要先将映像文件下载到本地计算机上,然后将其上传到虚拟机中。以下是下载映像文件的步骤:1.打开虚拟机管理软件,例如VMwareWorkstation或Virtual...

ghost系统盘制作(制作ghost启动盘)

首先,需要准备东西如下:光驱起码要支持DVD刻录吧,您要是Combo刻CD还真不好意思和别人打招呼。。。DVD白盘若干,一张随便什么样的可引导系统盘(里面有ghost的那种),nero软件,Ultra...

cad2008序列号和激活码(cad2008序列号密钥)

2008cad注册码是666-98989898。双击“AutoCAD2008Chs_运行获取激活码.exe”,将注册界面上的申请号粘贴到“AutoCAD2008Chs_运行获取激活码.exe”申请号一...

电脑无线网连不上怎么办(电脑无线网连接不上怎么回事)
电脑无线网连不上怎么办(电脑无线网连接不上怎么回事)

1、打开“控制面板”,点击“网络和Internet”。2、点击“网络和共享中心”。3、点击“更改适配器设置”。4、鼠标右键单击需要连接的网络,在弹出的对话框中,点击“属性”。5、选中“Internet协议版本4(TCP/IPv4)”,...

2025-11-28 23:55 liuian

u盘如何恢复删除的文件(如何恢复u盘中被删除的文件)

如果您在使用WPS时误删了U盘文件,可以使用以下几种方法来恢复文件:1.检查回收站:首先检查一下您的回收站中是否有被误删的文件,如果有,可以将文件恢复回来。2.使用WPS数据恢...

推特官网入口(推特官网入口网页登录网址)

首先在浏览器中打开推特的官网,然后点击页面上的“注册”创建账号。Twitter可以让用户更新不超过140个字符的消息(除中文、日文和韩语外已提高上限至280个字符),这些消息也被称作“推文(Tweet...

windows7如何清理c盘(win7怎么清理c盘)

1.打开桌面计算机,右键点击“C盘”,并选取“属性”。2.待新窗口弹出后,依次点击“工具”、“立即进行碎片整理”。3.最后,选取C盘,在按下“磁盘碎片整理”按钮,系统就会对C盘进行分析,并进行整理。4...

win10自带分区工具(win10官方分区工具)

Win10自带的分区工具是磁盘管理器,可以用来创建、删除、格式化和调整磁盘分区。下面是使用磁盘管理器分区的步骤:1.打开磁盘管理器。您可以在Windows10搜索栏中输入“磁盘管理器”来快速打开。...

appstore正版下载软件(apple store下载正版)

不会,他是正版的,因为只有ios系统可以用,但他里面的好游戏都是要收费的,所以打架都要越狱,去其它地方下载,不去商店的在安卓上,GooglePlayStore是类似于苹果的AppStore一...

手机锁屏密码键盘没了(手机输入密码的键盘没了怎么办)

如果手机锁屏密码的键盘找不到,首先要确认是否是由于软件问题导致的。可以尝试重启手机或者清理手机缓存来解决。如果问题仍然存在,可以尝试更换输入法或者恢复手机出厂设置来解决。如果以上方法都没有效果,建议联...

移动硬盘跟固态硬盘的区别(移动硬盘跟固态硬盘的区别是什么)

一:移动硬盘移动硬盘是指以传统机械磁盘作为存储介质,用于计算机之间交换大容量数据,讲究移动便携性的存储产品。优点:具有容量大、价格便宜的特点,方便存储大量文件数据。(推荐学习:web前端视频教程)缺...

windows怎么截图快捷键(windows截图快捷键没反应)

1、按Prtsc键截图这样获取的是整个电脑屏幕的内容,按Prtsc键后,可以直接打开画图工具,接粘贴使用。也可以粘贴在QQ聊天框或者Word文档中,之后再选择保存即可。2、按Ctrl+Prtsc键截图...

显示器分辨率有哪几种(显示器屏幕分辨率都有哪些)

目前使用较多的显示器分辨率有640*480,800*600,1024*768,1280*1024四种。刷新率,这主要是指显示器显示画面每秒刷新的次数,现在的电脑显示屏刷新率一般为75Hz,如果刷新率在...