交易型数据湖 - Apache Iceberg、Apache Hudi和Delta Lake的比较
liuian 2025-05-16 14:48 43 浏览
图片由作者提供
简介
构建数据湖最重要的决定之一是选择数据的存储格式,因为它可以大大影响系统的性能、可用性和兼容性。通过仔细考虑数据存储的格式,我们可以增强数据湖的功能和性能。
有几种不同的选择,每一种都有其独特的特点和能力。在这篇博文中,我们将对三种流行的数据湖技术进行彻底比较:Delta Lake, Iceberg, and Hudi.
数据湖格式解决了哪个问题?
当涉及到数据湖时,选择正确的数据存储格式是至关重要的。它可以大大影响系统的性能、可用性和兼容性。Apache Hudi、Apache Iceberg和Delta Lake是目前的三种顶级选择,每一种都是为解决数据湖管理中的具体挑战而设计的。这些挑战包括:
- 原子交易:确保对数据湖的更新或追加操作不会半途而废,使数据处于损坏的状态。
- 一致的更新:防止读取失败或在写入时返回不完整的结果,并处理可能发生冲突的潜在并发写入。
- 数据和元数据的可扩展性:当表增长到数千分区和数十亿文件的规模时,避免对象存储API和相关元数据的瓶颈。
通过解决这些挑战,这些数据存储格式可以大大改善数据湖的可靠性和效率。仔细考虑哪种格式最适合你的数据湖项目的具体需求和目标是很重要的。
ACID交易
在对象存储解决方案(无论是Amazon S3、Azure Blob Storage还是Google Cloud Storage)之上使用数据湖技术的优势之一是,它可以将ACID(原子、一致、隔离、持久)保证应用于更广泛的事务,包括插入、删除和更新。这些技术除了提供ACID功能外,还可以实现这些操作的并发执行。
ACID - Apache Iceberg
Apache Iceberg使用三类元数据来定义表:
- 定义表的 "元数据文件"。
- "清单列表",它定义了一个表格快照
- "清单",它定义了可能是一个或多个快照的一部分的数据文件组。
这些元数据层使Iceberg能够提供快照隔离和ACID支持,以及实现查询优化和其他功能。
当一个查询被运行,Iceberg使用最新的快照,除非另有规定。对一个表的写入会创建一个新的快照,这不会影响并发的查询。
Iceberg 通过乐观的并发性来处理并发性写入,在这种情况下,创建一个新快照的第一个写入是成功的,而其他的则被重试。
除了标准的创建、插入和合并,Iceberg还支持使用SQL命令的行级更新和删除。
ACID - Apache Hudi
Apache Hudi将所有交易组织成不同类型的行动,这些行动随着时间的推移而发生。它使用了一种基于目录的方法,带有时间戳的数据文件和跟踪这些数据文件中记录变化的日志文件。
可选的是,Hudi允许用户启用一个用于查询优化的元数据表,该表跟踪一个可用于查询规划(query plan)而不是文件操作的文件列表,有可能避免大数据集的瓶颈。
Hudi还支持原子交易和SQL命令,如CREATE TABLE, INSERT, UPDATE, DELETE和查询。
ACID - Delta Lake
Delta Lake跟踪两种类型的文件中的元数据:
- Delta日志,按顺序记录表的变化
- Checkpoint 检查点,它总结了到该点为止对表的所有变化,不包括相互抵消的交易。
Delta Lake还提供了ACID事务和SQL对创建、插入、合并、更新和删除的支持。
分区演变
分区是通过减少每次需要扫描的数据量来优化查询的一个有用工具。它们对于以一种易于有效查询的方式组织数据非常重要。
然而,一个表的分区方案可能需要随着时间的推移而改变。在诸如Hive这样的传统解决方案中,改变分区方案是一个耗时的过程,需要重写整个表。
为了更有效地管理数据,有能力更新表的分区方案而不需要重写所有以前的数据是很重要的。这就是所谓的分区演变。
分区演变 - 阿帕奇冰山
Apache Iceberg是目前唯一支持分区演变的表格式。Iceberg不依赖于特定列的值,而是基于分区列和应用于它的转换(如将时间戳转换为日或年)来跟踪分区。
这与传统的方法相比有很大的优势,传统的方法往往需要专门为分区创建额外的列,并要求用户知道通过分区列来过滤,以获得分区的好处。
如果没有这方面的知识,一个包括对时间戳列的过滤,但不包括从该时间戳衍生的分区列的查询,将导致全表扫描。Iceberg使用户能够从分区中获得最大的价值,并获得良好的性能,而不需要成为底层系统的专家。
由于Iceberg分区跟踪应用于一个特定列的转换,该转换可以根据需要修改。基于转换后的列进行过滤的查询将受益于分区,无论哪种转换被应用于数据的任何部分。
例如,一个时间戳列可以按年份划分,然后用ALTER TABLE语句轻松地切换到按月划分。
当数据被时间戳列过滤后,查询可以利用按年分区的部分和按月分区的部分进行划分。这些操作是使用SQL进行的。
分区进化为Iceberg提供了两个主要的好处:它允许改变一个表的分区方案,而不需要重写表;它使查询能够被所有的分区方案所优化(使用不同方案的数据分区将被单独规划以最大化性能)。
此外,Iceberg有一个特殊的功能,叫做隐藏分区,它不需要创建额外的分区列,需要明确的过滤才能从中受益。
分区演变--Apache Hudi
与Iceberg不同,Hudi不支持分区进化或隐藏分区。
然而,它确实通过其数据跳过功能提供了一个类似的结果,目前只支持读优化模式下的表。
这个功能允许Hudi在执行查询时跳过不必要的数据,可能会提高性能。
分区演变--Delta Lake
Delta Lake不支持分区演变,但它通过其生成的列功能提供了类似的能力,该功能目前在Databricks Delta Lake的公开预览中。
该功能允许用户创建额外的列,这些列来自于表中的现有数据,可能会提高对这些列进行过滤的查询的效率。
然而,这一功能在Delta Lake的开源版本中还没有得到完全支持。
模式的演变
随着数据和业务需求的变化,表的模式也在不断变化。列可能需要重新命名,改变类型,或添加新的列。所有这三种表格式都支持不同层次的模式演变,以允许这些变化。
发展表的模式的能力是一个重要的功能,因为它允许必要的更新,而不需要重写整个表,这可能是一个耗时且昂贵的操作。
时间旅行
时间旅行允许用户查询一个表,因为它存在于以前的一个时间点。
这对各种用途都很有用,例如在以前的模型测试中使用的相同数据上测试更新的机器学习算法。
将模型与相同的数据进行比较,对于理解模型的变化至关重要。
所有这三种表格格式都通过使用 "快照 "来支持时间旅行,快照基本上是表格在某个特定时间点的版本。
每个快照都包含与之相关的文件。定期清理旧的、不需要的快照以避免不必要的存储成本是很重要的。
每种表格式都有不同的工具来维护快照,一旦快照被删除,就不可能再有时间旅行到该快照。
时间旅行--Apache Iceberg
在Apache Iceberg中,每次对一个表进行更新时,都会创建一个快照。这允许用户指定一个快照的ID或时间戳,并查询该时间点上的数据。
为了维护Iceberg表,使用expireSnapshots过程定期过期快照以减少存储文件的数量是很重要的。
例如,你可能想让所有比今年早的快照过期。一旦快照过期,就不可能再回到过去。
时间旅行--Apache Hudi
Hudi的表格格式使用户能够通过跟踪带有时间戳的数据文件和日志文件中对表格所做的修改来查询时间轴上的先前点。
为了维护Hudi表,可以使用Hoodie Cleaner程序来清理旧的提交。然而,一旦这些提交被清理掉,就不可能再对它们进行时间旅行。
时间旅行--Delta Lake
Delta Lake允许你回到过去,查看你的表的先前版本。这可以通过针对特定的Delta文件来实现,这些文件代表了自上一个Delta文件以来对表所做的修改,或者通过使用检查点来实现,检查点总结了直到该点为止对表的所有修改。
默认情况下,Delta Lake维护一个表的最后30天的历史,但这可以通过数据保留设置来调整。为了清理旧的数据文件,实现更有效的时间旅行,你可以使用真空工具。
需要注意的是,如果某些日志文件被删除了,可能就不可能时间旅行到过去的某些点,因为没有检查点可以参考,以便重建表。
例如,如果你有日志1-30,检查点在日志15,删除日志1将禁用时间旅行到日志1-14,因为没有更早的检查点可用于重建表。
平台兼容性
如果数据专业人员使用的平台不能与之配合,那么表格格式就不会有用。在本节中,我们列出了一些比较流行的平台,用于分析和设计数据湖上的数据,以及它们对不同表格格式的支持。重要的是,不仅要能够读取数据,而且要能够写入数据,以便数据工程师和消费者能够使用他们的首选平台。
文件格式支持
当涉及到存储分析数据时,Parquet二进制列式文件格式通常是首选。然而,在有些情况下,你可能想使用其他文件格式,如AVRO或ORC,作为你的表格式。下图显示了哪些表格式允许构成一个表的数据文件。
那么谁是赢家?
当决定哪种表格格式最适合你的使用情况时,请考虑以下情况:
- 如果你主要关注的是管理具有大量分区的大表,并且元数据管理是一个痛点,可以考虑使用Apache Iceberg。它可以缓解与S3对象列表或Hive Metastore分区枚举有关的性能问题。然而,请记住,对删除和突变的支持仍然是有限的,而且在数据保留方面有一些操作开销。
- 如果你使用各种查询引擎并需要灵活地管理变异的数据集,Apache Hudi可能是一个很好的选择。然而,要注意的是,整体的开发者体验和支持工具可能没有其他选项那么精良。此外,为大规模生产工作负载安装和调整Hudi需要一些操作费用。另一方面,如果你使用AWS的管理服务,如Athena、Glue或EMR,Hudi已经预先安装和配置好了,并由AWS支持。
- 如果你主要使用Apache Spark,并期待相对较低的写入吞吐量,Delta Lake可能是一个不错的选择。如果你也是Databricks的客户,Delta引擎给读写性能和并发性都带来了明显的改善,因此值得在他们的生态系统上加倍努力。然而,如果你正在使用其他Apache Spark发行版,请记住,Delta Lake虽然是开源的,但作为一个产品差异化,可能总是落后于Delta Engine。
本文由闻数起舞翻译自
https://medium.com/geekculture/transactional-data-lakes-a-comparison-of-apache-iceberg-apache-hudi-and-delta-lake-9d7e58fd229b
相关推荐
-
- 驱动网卡(怎么从新驱动网卡)
-
网卡一般是指为电脑主机提供有线无线网络功能的适配器。而网卡驱动指的就是电脑连接识别这些网卡型号的桥梁。网卡只有打上了网卡驱动才能正常使用。并不是说所有的网卡一插到电脑上面就能进行数据传输了,他都需要里面芯片组的驱动文件才能支持他进行数据传输...
-
2026-01-30 00:37 liuian
- win10更新助手装系统(微软win10更新助手)
-
1、点击首页“系统升级”的按钮,给出弹框,告诉用户需要上传IMEI码才能使用升级服务。同时给出同意和取消按钮。华为手机助手2、点击同意,则进入到“系统升级”功能华为手机助手华为手机助手3、在检测界面,...
- windows11专业版密钥最新(windows11专业版激活码永久)
-
Windows11专业版的正版密钥,我们是对windows的激活所必备的工具。该密钥我们可以通过微软商城或者通过计算机的硬件供应商去购买获得。获得了windows11专业版的正版密钥后,我...
-
- 手机删过的软件恢复(手机删除过的软件怎么恢复)
-
操作步骤:1、首先,我们需要先打开手机。然后在许多图标中找到带有[文件管理]文本的图标,然后单击“文件管理”进入页面。2、进入页面后,我们将在顶部看到一行文本:手机,最新信息,文档,视频,图片,音乐,收藏,最后是我们正在寻找的[更多],单击...
-
2026-01-29 23:55 liuian
- 一键ghost手动备份系统步骤(一键ghost 备份)
-
步骤1、首先把装有一键GHOST装系统的U盘插在电脑上,然后打开电脑马上按F2或DEL键入BIOS界面,然后就选择BOOT打USDHDD模式选择好,然后按F10键保存,电脑就会马上重启。 步骤...
- 怎么创建局域网(怎么创建局域网打游戏)
-
1、购买路由器一台。进入路由器把dhcp功能打开 2、购买一台交换机。从路由器lan端口拉出一条网线查到交换机的任意一个端口上。 3、两台以上电脑。从交换机任意端口拉出网线插到电脑上(电脑设置...
- 精灵驱动器官方下载(精灵驱动手机版下载)
-
是的。驱动精灵是一款集驱动管理和硬件检测于一体的、专业级的驱动管理和维护工具。驱动精灵为用户提供驱动备份、恢复、安装、删除、在线更新等实用功能。1、全新驱动精灵2012引擎,大幅提升硬件和驱动辨识能力...
- 一键还原系统步骤(一键还原系统有哪些)
-
1、首先需要下载安装一下Windows一键还原程序,在安装程序窗口中,点击“下一步”,弹出“用户许可协议”窗口,选择“我同意该许可协议的条款”,并点击“下一步”。 2、在弹出的“准备安装”窗口中,可...
- 电脑加速器哪个好(电脑加速器哪款好)
-
我认为pp加速器最好用,飞速土豆太懒,急速酷六根本不工作。pp加速器什么网页都加速,太任劳任怨了!以上是个人观点,具体性能请自己试。ps:我家电脑性能很好。迅游加速盒子是可以加速电脑的。因为有过之...
- 任何u盘都可以做启动盘吗(u盘必须做成启动盘才能装系统吗)
-
是的,需要注意,U盘的大小要在4G以上,最好是8G以上,因为启动盘里面需要装系统,内存小的话,不能用来安装系统。内存卡或者U盘或者移动硬盘都可以用来做启动盘安装系统。普通的U盘就可以,不过最好U盘...
- u盘怎么恢复文件(u盘文件恢复的方法)
-
开360安全卫士,点击上面的“功能大全”。点击文件恢复然后点击“数据”下的“文件恢复”功能。选择驱动接着选择需要恢复的驱动,选择接入的U盘。点击开始扫描选好就点击中间的“开始扫描”,开始扫描U盘数据。...
- 系统虚拟内存太低怎么办(系统虚拟内存占用过高什么原因)
-
1.检查系统虚拟内存使用情况,如果发现有大量的空闲内存,可以尝试释放一些不必要的进程,以释放内存空间。2.如果系统虚拟内存使用率较高,可以尝试增加系统虚拟内存的大小,以便更多的应用程序可以使用更多...
-
- 剪贴板权限设置方法(剪贴板访问权限)
-
1、首先打开iphone手机,触碰并按住单词或图像直到显示选择选项。2、其次,然后选取“拷贝”或“剪贴板”。3、勾选需要的“权限”,最后选择开启,即可完成苹果剪贴板权限设置。仅参考1.打开苹果手机设置按钮,点击【通用】。2.点击【键盘】,再...
-
2026-01-29 21:37 liuian
- 平板系统重装大师(平板重装win系统)
-
如果你的平板开不了机,但可以连接上电脑,那就能好办,楼主下载安装个平板刷机王到你的个人电脑上,然后连接你的平板,平板刷机王会自动识别你的平板,平板刷机王上有你平板的我刷机包,楼主点击下载一个,下载完成...
- 联想官网售后服务网点(联想官网售后服务热线)
-
联想3c服务中心是联想旗下的官方售后,是基于互联网O2O模式开发的全新服务平台。可以为终端用户提供多品牌手机、电脑以及其他3C类产品的维修、保养和保险服务。根据客户需求层次,联想服务针对个人及家庭客户...
- 一周热门
-
-
飞牛OS入门安装遇到问题,如何解决?
-
用什么工具在Win中查看8G大的log文件?
-
如何在 Windows 10 或 11 上通过命令行安装 Node.js 和 NPM
-
Trae IDE 如何与 GitHub 无缝对接?
-
如何修改图片拍摄日期?快速修改图片拍摄日期的6种方法
-
5步搞定动态考勤表!标记节假日、调休日?Excel自动变色!
-
RK3588-HDMIRX(瑞芯微rk3588芯片手册)
-
用纯Python轻松构建Web UI:Remi 动态更新,实时刷新界面内容
-
tplink无线路由器桥接教程(tplink路由器如何进行无线桥接)
-
都说Feign是RPC,没有侵入性,为什么我的代码越来越像 C++
-
- 最近发表
- 标签列表
-
- python判断字典是否为空 (50)
- crontab每周一执行 (48)
- aes和des区别 (43)
- bash脚本和shell脚本的区别 (35)
- canvas库 (33)
- dataframe筛选满足条件的行 (35)
- gitlab日志 (33)
- lua xpcall (36)
- blob转json (33)
- python判断是否在列表中 (34)
- python html转pdf (36)
- 安装指定版本npm (37)
- idea搜索jar包内容 (33)
- css鼠标悬停出现隐藏的文字 (34)
- linux nacos启动命令 (33)
- gitlab 日志 (36)
- adb pull (37)
- python判断元素在不在列表里 (34)
- python 字典删除元素 (34)
- vscode切换git分支 (35)
- python bytes转16进制 (35)
- grep前后几行 (34)
- hashmap转list (35)
- c++ 字符串查找 (35)
- mysql刷新权限 (34)
