kettle优化抽取数据速度_数据异构工具介绍
一:Data Migration(DM)
1、Data Migration 简介:
Data Migration (DM) 是一体化的数据同步任务管理平台,支持从 MySQL 到 TiDB或者MySQL 的全量数据迁移和增量数据同步。使用 DM 工具有利于简化错误处理流程,降低运维成本。
2、DM 架构:
DM 主要包括三个组件:DM-master,DM-worker 和 dmctl。
- DM-master 负责管理和调度数据同步任务的各项操作。
- DM-worker 负责执行具体的数据同步任务。
- dmctl 是用来控制 DM 集群的命令行工具。
3、核心功能:
- 路由表(Table routing) :是指将上游 MySQL 或 MariaDB 实例的某些表同步到下游指定表的路由功能,可以用于分库分表的合并同步。
- 黑白名单(Black & white table lists) :是指上游数据库实例表的黑白名单过滤规则。其过滤规则类似于 MySQL replication-rules-db/replication-rules-table,可以用来过滤或只同步某些数据库或某些表的所有操作。
- 事件过滤器(Binlog event filter)是比库表同步黑白名单更加细粒度的过滤规则,可以指定只同步或者过滤掉某些 schema/table 的指定类型的 binlog events,比如 INSERT,TRUNCATE TABLE,DELETE等。
- 列映射(Column mapping): 提供对表的列值进行修改的功能。可以根据不同的表达式对表的指定列做不同的修改操作,目前只支持 DM 提供的内置表达式。partition id 表达式用于解决分库分表合并同步的自增主键的冲突。
- 分库分表合并:此功能用于将上游 MySQL/MariaDB 实例中结构相同的表同步到下游 TiDB 的同一个表中。DM 不仅支持同步上游的 DML 数据,也支持协调同步多个上游分表的 DDL表结构变更。
二:DataX
1、DataX3.0简介:
DataX 是阿里巴巴集团内被广泛使用的离线数据同步工具/平台,实现包括 MySQL、Oracle、SqlServer、Postgre、HDFS、Hive、ADS、HBase、TableStore(OTS)、MaxCompute(ODPS)、DRDS 等各种异构数据源之间高效的数据同步功能。
为了解决异构数据源同步问题,DataX将复杂的网状的同步链路变成了星型数据链路,DataX作为中间传输载体负责连接各种数据源。当需要接入一个新的数据源的时候,只需要将此数据源对接到DataX,便能跟已有的数据源做到无缝数据同步。
- Reader:Reader为数据采集模块,负责采集数据源的数据,将数据发送给Framework。
- Writer: Writer为数据写入模块,负责不断向Framework取数据,并将数据写入到目的端。
- Framework:Framework用于连接reader和writer,作为两者的数据传输通道,并处理缓冲,流控,并发,数据转换等核心技术问题。
三:kettle
1、Kettle简介:
Kettle 是一款使用 Java 编写的功能强大的 ETL ( Extract Transform and Load )工具,支持关系型数据库( MySQL 、 Oracle 等)、非关系型数据库( MongoDB 、 ElasticSearch 等)以及文件之间的大规模数据迁移。功能相对完善,任务执行可以监控报警。
- Kettle这个ETL工具集,它允许你管理来自不同数据库的数据,通过提供一个图形化界面来操作数据的转换和输出等。
- Kettle中有两种脚本文件,transformation(.ktr)和job(.kjb),transformation完成针对数据的基础转换,job则完成整个工作流的控制。
2、DataX和kettle对比:
总结
以上是生活随笔为你收集整理的kettle优化抽取数据速度_数据异构工具介绍的全部内容,希望文章能够帮你解决所遇到的问题。
- 上一篇: javafx应用启动自动执行函数_一张图
- 下一篇: 如何保证战略落地_战略如何规划落地?值得