分布式文件系统 发表于 2020-11-16 | 分类于 java 分布式文件系统FastDfs概念FastDFS是一个开源的分布式文件系统,她对文件进行管理,功能包括:文件存储、文件同步、文件访问(文件上传、文件下载)等,解决了大容量存储和负载均衡的问题。特别适合以文件为载体的在线服务,如相册网站、视频网站等等。 FastDfs架构图 FastDfs上传过程 Fa ... 阅读全文 »
读写分离、分库分表 发表于 2020-11-05 | 分类于 架构 读写分离、分库分表1.读写分离、分库分表 如何选择垂直切分、水平切分 mycat快速体验 mycat用户配置 mycat的schema配置实操 mysql主从配置 mycat粉片规则配置(枚举分片、取模) mycat全局表、子表 ... 阅读全文 »
Storm学习 发表于 2020-10-22 | 分类于 bigdata Storm学习1.导学VMware Fusion Mac上搭建:为了给大家演示如何使用我们的OOTB环境 Hadoop环境:虚拟机,我是远程登录 Mac 那么就不需要使用我们的OOTB环境 VMware Fusion+OOTB Window:VMware ... 阅读全文 »
hadoop基础 发表于 2020-10-21 | 分类于 bigdata hadoop基础1.大数据概述大数据带来的技术变革 技术驱动:数据量大 存储:文件存储 ==> 分布式存储 计算:单机 ==> 分布式计算 网络:万兆 DB: RDBMS ==> NoSQL(HBase/Redi ... 阅读全文 »
flink学习笔记 发表于 2020-10-16 | 分类于 bigdata Flink学习笔记1.初识FLinkFlink是什么Apache Flink是一个框架和分布式处理引擎,用于对无限制和有限制的数据流进行有状态的计算。Flink被设计为可在所有常见的集群环境中运行,以内存速度和任何规模执行计算。 Unbounded data: 有头无尾 Bounded data: ... 阅读全文 »
架构设计&分布式&数据结构与算法笔记 发表于 2020-07-19 | 分类于 bigdata 架构设计-分布式-数据结构与算法笔记架构设计请列举出在JDK中几个常用的设计模式?单例模式(Singleton pattern)用于Runtime,Calendar和其他的一些类中。工厂模式(Factory pattern)被用于各种不可变的类如 Boolean,像Boolean.valueOf,观 ... 阅读全文 »
ZooKeeper笔记 发表于 2020-07-18 | 分类于 bigdata Zookeeper笔记1. ZooKeeper 是什么?ZooKeeper 是一个开源的分布式协调服务。它是一个为分布式应用提供一致性服务的软件,分布式应用程序可以基于 Zookeeper 实现诸如数据发布/订阅、负载均衡、命名服务、分布式协调/通知、集群管理、Master选举、分布式锁和分布式队列 ... 阅读全文 »
Tomcat笔记 发表于 2020-07-17 | 分类于 bigdata Tomcat笔记Tomcat是什么?Tomcat 服务器Apache软件基金会项目中的一个核心项目,是一个免费的开放源代码的Web 应用服务器,属于轻量级应用服务器,在中小型系统和并发访问用户不是很多的场合下被普遍使用,是开发和调试JSP 程序的首选。 Tomcat的缺省端口是多少,怎么修改 找到T ... 阅读全文 »
flume、sqoop笔记 发表于 2020-07-12 | 分类于 bigdata flume、sqoop笔记1.什么是flumea.Flume是一个分布式、可靠、和高可用的海量日志采集、聚合和传输的系统。 b.Flume可以采集文件,socket数据包等各种形式源数据,又可以将采集到的数据输出到HDFS、hbase、hive、kafka等众多外部存储系统中 c.一般的采集需求,通 ... 阅读全文 »
hive调优 发表于 2020-07-12 | 分类于 bigdata hive调优 HIVE调优是一个很大的课题,涉及到hive本身的调优,hive底层的mapreduce计算引擎的调优,sql的调优,数据倾斜调优,小文件问题的调优,数据压缩的调优等 以下提供一些主要的调优总结: 1.数据的压缩与存储格式 hive底层的计算引擎是mapreduce,而mapreduc ... 阅读全文 »