最新 最热

Spark算子官方文档整理收录大全持续更新【Update2023/6/24】

本文基于Spark 3.2.0 Scala的RDD API,内容来源主要由官方文档整理,文中所整理算子为常用收录,并不完全。在Spark RDD官方文档中按照转换算子(Transformation )和行动算子(Action)进行分类,在RDD.scala文档中按照RDD的内部...

2024-07-25
19

Linux大数据Hadoop生态组件常用命令速查手册

因为spark的群起命令会和hdfs的命令冲突,所以spark执行命令时使用绝对路径。

2024-07-25
15

HiveSQL练习题:计算近一个月活跃、连续活跃、沉默用户需求

set hive.exec.mode.local.auto=true; 开启hive的local模式

2024-07-25
16

【Spark数仓项目】需求六:构建设备会话维表

本需求继续针对dwd.event_log_detail表深度开发,完成对dws.mall_app_session_agr表(设备会话维表)的构建。 本次需求更接近业务,查询结果可用于数据报表呈现使用。 以下是需求结果字段案例:...

2024-07-25
18

【Spark数仓项目】需求七:漏斗模型分析

create table dwd.tmp_event_log_detail( – dwd.event_log_detail deviceid string, eventid string, properties map<string,string>, ts bigint )partitioned by (dt...

2024-07-25
15

【Spark数仓项目】需求八:MySQL的DataX全量导入和增量导入Hive

本需求将模拟从MySQL中向Hive数仓中导入数据,数据以时间分区。测试两种导入场景,一种是将数据全量导入,即包含所有时间分区;另一种是每天运行调度,仅导入当天时间分区中的用户数据。...

2024-07-25
19

Hive 中 sort by 和 order by 的区别

在 Hive 中, SORT BY 和 ORDER BY 都用于对查询结果进行排序,但它们在实现方式和适用场景上有一些区别。

2024-07-25
18

Spark中使用RDD算子GroupBy做词频统计的方法

测试文件在本地D://tmp/spark.txt,Spark采用Local模式运行,Spark版本3.2.0,Scala版本2.12,集成idea开发环境。

2024-07-25
18

使用ReduceByKey在Spark中进行词频统计

Spark采用Local模式运行,Spark版本3.2.0,Scala版本2.12,集成idea开发环境。

2024-07-25
16

颜色追踪python编程

在Python中,可以使用OpenCV库来实现颜色追踪。下面是一个简单的示例代码,演示如何使用OpenCV来追踪指定颜色的对象:

2024-07-25
22