数仓笔记 发表于 2020-07-11 | 分类于 bigdata 数仓笔记1.维表和宽表的考查(主要考察维表的使用及维度退化手法)维表数据一般根据ods层数据加工生成,在设计宽表的时候,可以适当的用一些维度退化手法,将维度退化到事实表中,减少事实表和维表的关联 2.数仓表命名规范每个公司都会有点差别 ODS ods.库名_表名_df/di/da/dz CDM(dw ... 阅读全文 »
Hbase笔记 发表于 2020-07-11 | 分类于 bigdata Hbase笔记1.Hbase调优 高可用在HBase中Hmaster负责监控RegionServer的生命周期,均衡RegionServer的负载,如果Hmaster挂掉了,那么整个HBase集群将陷入不健康的状态,并且此时的工作状态并不会维持太久。所以HBase支持对Hmaster的高可用配置。 ... 阅读全文 »
Kafka笔记 发表于 2020-07-10 | 分类于 bigdata Kafka笔记1.Kafka名词解释和工作方式 Producer :消息生产者,就是向kafka broker发消息的客户端。 Consumer :消息消费者,向kafka broker取消息的客户端 Topic :咋们可以理解为一个队列。 Consumer Group (CG):这是kafka用来 ... 阅读全文 »
Spark笔记 发表于 2020-07-06 | 分类于 bigdata Spark笔记1.rdd的属性 一组分片(Partition),即数据集的基本组成单位。对于RDD来说,每个分片都会被一个计算任务处理,并决定并行计算的粒度。用户可以在创建RDD时指定RDD的分片个数,如果没有指定,那么就会采用默认值。默认值就是程序所分配到的CPU Core的数目。 一个计算每个分 ... 阅读全文 »
hive笔记 发表于 2020-07-05 | 分类于 bigdata hive笔记1.大表join小表产生的问题,怎么解决?mapjoin优化是在Map阶段进行join,而不是通常那样在Reduce阶段按照join列进行分发后在每个Reduce节点上进行join,不需要分发也就没有倾斜的问题,相反,Hive会将小表全量复制到每个Map任务节点(对于本例是dim_sel ... 阅读全文 »
Hadoop笔记 发表于 2020-07-02 | 分类于 bigdata Hadoop笔记一.Hadoop1.hdfs写流程 客户端跟namenode通信请求上传文件,namenode检查目标文件是否已存在,父目录是否存在 namenode返回是否可以上传 client请求第一个 block该传输到哪些datanode服务器上 namenode返回3个datanode服 ... 阅读全文 »
MySQL数据库笔记 发表于 2020-07-01 | 分类于 java MySQL数据库笔记数据库基础知识为什么要使用数据库数据保存在内存 优点: 存取速度快 缺点: 数据不能永久保存 数据保存在文件 优点: 数据永久保存 缺点:1)速度比内存操作慢,频繁的IO操作。2)查询数据不方便 数据保存在数据库 1)数据永久保存 2)使用SQL语句,查询方便效率高。 3)管理数 ... 阅读全文 »
Redis笔记 发表于 2020-06-30 | 分类于 java Redis概述什么是RedisRedis(Remote Dictionary Server) 是一个使用 C 语言编写的,开源的(BSD许可)高性能非关系型(NoSQL)的键值对数据库。 Redis 可以存储键和五种不同类型的值之间的映射。键的类型只能为字符串,值支持五种数据类型:字符串、列表、集合 ... 阅读全文 »
MyBatis笔记 发表于 2020-06-30 | 分类于 java MyBatis笔记MyBatis简介MyBatis是什么?MyBatis 是一款优秀的持久层框架,一个半 ORM(对象关系映射)框架,它支持定制化 SQL、存储过程以及高级映射。MyBatis 避免了几乎所有的 JDBC 代码和手动设置参数以及获取结果集。MyBatis 可以使用简单的 XML 或注 ... 阅读全文 »
Spring Cloud笔记 发表于 2020-06-30 | 分类于 java Spring Cloud笔记为什么需要学习Spring Cloud不论是商业应用还是用户应用,在业务初期都很简单,我们通常会把它实现为单体结构的应用。但是,随着业务逐渐发展,产品思想会变得越来越复杂,单体结构的应用也会越来越复杂。这就会给应用带来如下的几个问题: 代码结构混乱:业务复杂,导致代码量很 ... 阅读全文 »