最新 最热

Kafka面试题持续更新【2023-07-14】

(1)Producer :消息生产者,就是向 kafka broker 发消息的客户端;

2024-07-25
20

Flink面试题持续更新【2023-07-21】

Flink和传统的Spark Streaming是两种流处理框架,它们在设计理念、功能特性和处理模型上存在一些区别。

2024-07-25
18

Windows常见蓝屏哪项

1. 停止错误(STOP Error):这是最常见的蓝屏错误,它通常以0x开头,后面跟着一串十六进制数字。这种错误通常是由硬件故障、驱动程序问题、操作系统错误或内存问题引起的。...

2024-07-25
36

【Flink实时数仓】需求二:用户事件信息宽表的构建 Kafka Hbase Flink

实时中的宽表其实是在退维,退维是数据处理中的一种操作,它是将细粒度的数据合并、归并为粗粒度数据的过程。在数据处理的过程中,原始数据往往包含大量的细节和细粒度信息,而有时候我们需要将这些细粒度数据转化为更高层次...

2024-07-25
23

基于MapReduce的Hive数据倾斜场景以及调优方案

通常认为当所有的map task全部完成,并且99%的reduce task完成,只剩下一个或者少数几个reduce task一直在执行,这种情况下一般都是发生了数据倾斜。

2024-07-25
19

Spark 为什么比 MapReduce 快100倍?

通常我们认为 Spark 引擎是基于内存进行计算,无论如何,速度都是比 MapReduce 快,因为 MapReduce 需要频繁 Shuffle 。在 Spark 的官网早期介绍中,也有过一张 Spark 比 Hadoop 计算速度快100倍的宣传,虽然它似乎违反了我们...

2024-07-25
21

Hive中Join优化的几种算法

Common Join 是最稳定且默认的Join算法,通过 MR Job 完成 Join 。

2024-07-25
20

使用Python创建faker实例生成csv大数据测试文件并导入Hive数仓

这段代码使用Faker库生成模拟的个人信息数据,每个CSV文件包含一定数量的行数据,数据字段包括 Rowkey, Name, Age, Email, Address, IDNumber, PhoneNumber, Nationality, Region, SourceCode。...

2024-07-25
23

Hive跨集群数据迁移过程

本次迁移数据100G,15亿条,数据流转方向从集群A经过跳转机到集群B,通过HDFS拉取和重新建表导入的方式完成数据库迁移。

2024-07-25
23

Hive中parquet压缩格式分区表的跨集群迁移记录

从华为A集群中将我们的数据迁移到华为B集群,其中数据经过华为集群管理机local跳转。

2024-07-25
17