百度360必应搜狗淘宝本站头条
当前位置:网站首页 > IT知识 > 正文

Amazon Kinesis Firehose-简单,高扩展性的数据摄入

liuian 2025-04-29 02:06 22 浏览

两年前,我们引入了 Amazon Kinesis,现在我们称之为Kinesis Streams,使你能够构建应用,以很高的吞吐量来收集,处理和分析流数据。我们想使你不用考虑构建和运行摄入服务器舰队或担忧监控,伸缩或交付可靠性。

Amazon Kinesis Firehose是为特定用途构建的,旨在使你能够更轻松地将流数据加载到AWS中。你仅仅创建一个交付流,将其路由到一个Amazon Simple Storage Service (S3)桶中和/或一个Amazon Redshift表中,将记录(每条记录最大1000KB)写入到流中。在这些场景背后,Firehose 将会为你料理好监控,伸缩,和数据管理所有这些方面。

再一次(我从不厌烦说这句),你可以花费更多的时间聚焦于你的应用,耗费较少的时间在基础设施上。

Firehose 内部机制

为了使事情保持简单,Firehose 不以任何方式对原始数据进行翻译或处理。你仅仅创建一个交付流,将数据记录写入该流中。在任何应要求而进行的压缩(客户端侧)和加密(服务器侧)后,记录被写入你指定的一个S3桶中。正如我的同事 James Hamilton(在其他语境中)喜欢说的那样,“它是那样地简单。”如果有必要,你甚至可以控制数据流缓冲区大小和缓冲间隔。

如果你的客户端代码在将记录送到Firehose 前对单个的逻辑记录进行隔离,它可以添加一个分隔符。否则,你可以稍后,一旦数据进入到云中,再识别记录的界限。

你的数据在S3中存储后,你有多种选择对其进行分析和处理。例如,你可以将一个 AWS Lambda函数附加到桶中,在对象到达桶中时对其进行处理。或者,你可以将你既存的Amazon EMR任务指向该桶,不需对任务做任何改动即可使其处理最新数据。

你也可以使用Firehose ,将你的数据路由到一个 Amazon Redshift集群。在Firehose 将你的原始数据存储到S3对象中后,它可以在每一个对象中调用一个RedshiftCOPY命令。这一命令很灵活,使你能够导入和处理多种格式(CVS,JSON,AVRO等等)的数据,仅隔离和存储筛选的列,将数据从一种类型转换为另一种类型,等等。

Firehose特性在控制台中的使用

你可以在 AWS Management Console(AWS管理控制台),AWS Command Line Interface (CLI,AWS命令行界面),或通过Firehose API完成以上功能。

让我们使用Firehose 控制台来创建一个交付流。我仅仅打开控制台,点击Create Delivery Stream。然后,我给我的交付流赋予了一个名称,选择了一个S3桶(或者创建一个新桶),创建一个IAM角色以便Firehose有权限向桶中写入数据:

我可以为交付流配置时延和压缩操作。我也可以选择使用我的一个 AWS Key Management Service(KMS,密钥管理业务)密钥加密数据:

一旦我的交付流创建完毕,我就可以在控制台中看到它了。

发布到一个交付流

下面是一些简单的Java代码,用来将一条记录(字符串“some data”)发布到我的流中:

PutRecordRequest putRecordRequest = new PutRecordRequest; 
putRecordRequest.setFirehoseName("incoming-stream"); 

String data = "some data" + "\n"; // add \n as a record separator 
Record record = new Record; 
record.setData(ByteBuffer.wrap(data.getBytes(StandardCharsets.UTF_8))); 

putRecordRequest.setRecord(record); 
firehoseClient.putRecord(putRecordRequest);

下面是在使用CLI环境下将记录发布到流中所使用的代码:

$ aws firehose put-record --delivery-stream-name incoming-stream --record Data="some data\n"

我们也提供了一个运行Linux 操作系统的代理。可以配置该代理监控另一个日志文件,并将它们路由到Firehose。

监控Kinesis Firehose 交付流

你可以在控制台中监控你的每一个交付流的CloudWatch 测量指标:

特性有关的数值

单个的交付流可以伸缩,每个小时可容纳多个十亿字节的数据。默认情况下,每一个流每秒可支持2500次对PutRecord或PutRecordBatch的调用,每个AWS账户你可以有多达五个流(这两个值都是管理者设置的限制,根据请求可以增加,所以只问问你是否需要设置更大的数值)。

该特性现在已可用了,你今天就可以开始使用它了。它是根据每个Firehose 摄入的数据量的大小定价的。

相关推荐

MySQL合集-mysql5.7及mysql8的一些特性

1、Json支持及虚拟列1.1jsonJson在5.7.8原生支持,在8.0引入了json字段的部分更新(jsonpartialupdate)以及两个聚合函数,JSON_OBJECTAGG,JS...

MySQL 双表架构在房产中介房源管理中的深度实践

MySQL房源与价格双表封神:降价提醒实时推送客户房产中介实战:MySQL空间函数精准定位学区房MySQL狠招:JSON字段实现房源标签自由组合筛选房源信息与价格变更联动:MySQL黄金搭档解决客户看...

MySQL 5.7 JSON 数据类型使用总结

从MySQL5.7.8开始,MySQL支持原生的JSON数据类型。MySQL支持RFC7159定义的全部json数据类型,具体的包含四种基本类型(strings,numbers,boolea...

MySQL 8.0 SQL优化黑科技,面试官都不一定知道!

前言提到SQL优化,大多数人想到的还是那些经典套路:建索引、避免全表扫描、优化JOIN顺序…这些确实是基础,但如果你还停留在MySQL5.7时代的优化思维,那就out了。MySQL8.0已经发布好...

如何在 MySQL 中使用 JSON 数据(mysql的json函数与实例)

在MySQL中学习“NoSQL”MySQL从5.7版本开始就支持JSON格式的数据类型,该数据类型支持JSON文档的自动验证和优化存储和访问。尽管JSON数据最好存储在MongoDB等...

MySQL中JSON的存储原理(mysql中json字段操作)

前言:表中有json字段后,非索引查询性能变得非常糟糕起因是我有一张表,里面有json字段后,而当mysql表中有200w数据的时候,走非索引查询性能变得非常糟糕需要3到5s。因此对mysql的jso...

mysql 之json字段详解(多层复杂检索)

MySQL5.7.8开始支持JSON数据类型。MySQL8.0版本中增加了对JSON类型的索引支持。示例表CREATETABLE`users`(`id`intNOTNULLAU...

VMware vCenter Server 8.0U3b 发布下载,新增功能概览

VMwarevCenterServer8.0U3b发布下载,新增功能概览ServerManagementSoftware|vCenter请访问原文链接:https://sysin.or...

Spring Boot 3.x 新特性详解:从基础到高级实战

1.SpringBoot3.x简介与核心特性1.1SpringBoot3.x新特性概览SpringBoot3.x是建立在SpringFramework6.0基础上的重大版...

如何设计Agent的记忆系统(agent记忆方法)

最近看了一张画Agent记忆分类的图我觉得分类分的还可以,但是太浅了,于是就着它的逻辑,仔细得写了一下在不同的记忆层,该如何设计和选型先从流程,作用,实力和持续时间的这4个维度来解释一下这几种记忆:1...

Spring Boot整合MyBatis全面指南:从基础到高级应用(全网最全)

一、基础概念与配置1.1SpringBoot与MyBatis简介技术描述优点SpringBoot简化Spring应用开发的框架,提供自动配置、快速启动等特性快速开发、内嵌服务器、自动配置、无需X...

5大主流方案对比:MySQL千亿级数据线上平滑扩容实战

一、扩容方案剖析1、扩容问题在项目初期,我们部署了三个数据库A、B、C,此时数据库的规模可以满足我们的业务需求。为了将数据做到平均分配,我们在Service服务层使用uid%3进行取模分片,从而将数据...

PostgreSQL 技术内幕(五)Greenplum-Interconnect模块

Greenplum是在开源PostgreSQL的基础上,采用MPP架构的关系型分布式数据库。Greenplum被业界认为是最快最具性价比的数据库,具有强大的大规模数据分析任务处理能力。Greenplu...

在实际操作过程中如何避免出现SQL注入漏洞

一前言本文将针对开发过程中依旧经常出现的SQL编码缺陷,讲解其背后原理及形成原因。并以几个常见漏洞存在形式,提醒技术同学注意相关问题。最后会根据原理,提供解决或缓解方案。二SQL注入漏洞的原理、形...

运维从头到尾安装日志服务器,看这一篇就够了

一、rsyslog部署1.1)rsyslog介绍Linux的日志记录了用户在系统上一切操作,看日志去分析系统的状态是运维人员必须掌握的基本功。rsyslog日志服务器的优势:1、日志统一,集中式管理...