简介 Hadoop 从 1970 年开始,大多数的公司数据存储和维护使用的是关系型数据库 大数据技术出现后,很多拥有海量数据的公司开始选择像Hadoop的方式来存储海量数据 Hadoop使用分布式文件系统HDFS来存储海量数据,并使用 MapReduce 来处理。Hadoop擅长于存储各种格式的庞大的数据,任意的格式甚至非结构化的处理 Hadoop…
Apache Flume简介 概述 Flume是Cloudera提供的一个高可用的,高可靠的,分布式的海量日志采集、聚合和传输的软件。 Flume的核心是把数据从数据源(source)收集过来,再将收集到的数据送到指定的目的地(sink)。为了保证输送的过程一定成功,在送到目的地(sink)之前,会先缓存数据(channel),待数据真正到达目的地…
需求 在现代的系统开发中, 为了提高搜索效率 , 以及搜索的精准度, 会大量的使用redis , memcache等nosql系统的数据库 , 以及solr , elasticsearch 类似的全文检索服务; 那么这个时候, 就又有一个问题需要我们来考虑, 就是数据同步的问题, 如何将实时变化的数据库中的数据同步到solr的索引库中或者redis…
Cassandra的介绍 概述 来自百科的介绍 Cassandra是一套开源分布式NoSQL数据库系统。它最初由Facebook开发,用于储存收件箱等简单格式数据,集GoogleBigTable的数据模型与Amazon Dynamo的完全分布式的架构于一身Facebook于2008将 Cassandra 开源,此后,由于Cassandra良好的可扩…
前置技能 学习本课程需要你最少需要掌握: 基本的Scala语言使用 了解Spark、SparkSQL 对大数据技术体系有一定的了解 如达不到前置技能的要求,可能在理解上比较困难,建议同学们可以先了解一下相关内容后,再来学习本课程。 数据湖概念[了解] 步骤 了解企业数据使用方面的需求 了解需求催生数据湖架构 数据湖和传统的数仓的简单对比 企业的数据…
Nifi概念 Nifi是什么 Apache NiFi 是一个易于使用,功能强大且可靠的系统,用于处理和分发数据。可以自动化管理系统间的数据流。它使用高度可配置的指示图来管理数据路由、转换和系统中介逻辑,支持从多种数据源动态拉取数据。NiFi原来是NSA的一个项目,目前已经代码开源,是Apache基金会的顶级项目之一。 NiFi是基于Java的,使用…
RabbitMQ 消息不丢失 消息不重复 消息堆积 延迟队列&死信队列 高可用机制 Kafka 消息不丢失&消息重复消费 消费顺序性 高可用机制 高性能设计 比较费时的数据拷贝 优化后的数据拷贝 数据存储和清理
Spring Bean线程安全问题 AOP 事务原理 事务失效 Bean的生命周期 循序依赖 SpringMVC 执行流程 Springboot 自动配置原理 Spring框架常见注解(Spring、Springboot、Springmvc) Mybatis 执行流程 延迟加载 一二级缓存 SpringCloud 服务注册 nacos、eureka…
Apache Sqoop sqoop介绍 Apache Sqoop是在Hadoop生态体系和RDBMS体系之间传送数据的一种工具。来自于Apache软件基金会提供。 Sqoop工作机制是将导入或导出命令翻译成mapreduce程序来实现。在翻译出的mapreduce中主要是对inputformat和outputformat进行定制。 Hadoop生…
Apache Impala Impala基本介绍 impala是cloudera提供的一款高效率的sql查询工具,提供实时的查询效果,官方测试性能比hive快10到100倍,其sql查询比sparkSQL还要更加快速,号称是当前大数据领域最快的查询sql工具, impala是参照谷歌的新三篇论文(Caffeine--网络搜索引擎、Pregel--分…