正文

Hive是基于Hadoop的一个数据仓库工具，用来进行数据抽取，转化，加载，这是一种可以存储，查询和分析存储在Hadoop中的大规模数据的机制。Hive数据仓库工具能将结构化的数据文件映射成一张表，并提供SQL查询功能，能将SQL语句转化成为MapReduce来执行。Hive的优点是学习成本低，可以通过类SQL语句实现快速MapReduce统计，使MapReduce变得更加简单，而不必开发专门的MapReduce任务。Hive十分适合对数据仓库进行分析。

二、架构

三、表分类

内部表：未被External修饰的是内部表(Managed Table)，数据由自身管理，数据存储的位置是hive.metastore.warehouse.dir，(默认：/user/hive/warehouse)删除内部表会直接删除元数据(Metadata)及存储数据；对内部表的修改会将修改直接同步给元数据。

外部表：被External修饰的是外部表(External Table)，数据由HDFS管理，部表数据的存储位置由自己制定(如果没有LOCATION，Hive将在HDFS上的/user/hive/warehouse文件夹下以外部表的表名创建一个文件夹，并将属于这个表的数据存放在这里)，删除外部表仅仅会删除元数据，HDFS上的文件并不会被删除，而对外部表的表结构和分区进行修改，则需要修复(MSCK REPAIR TABLE table_name)。

四、Hive常用语句

1.Hive建表语句

create table t1( id int,
name string ,
hobby array<string> ,
add map<String,
string> ) 
row format delimited 
fields terminated by ',' 
collection items terminated by '-' 
map keys terminated by ':' ;

2.Hive新增列

alter table test.t1 add columns(a string);

3.Hive删除列

alter table test.t1 replace columns(id int,name string,hobby array<string>,add map<string,string>);

4.Hive修改列

alter table test.t1 change a b int;

5.Hive清空表

truncate table test.t1;

6.Hive加载数据

load data local inpath '/home/hadoopap/desktop/data' overwrite into table t1;

7.HDFS删除文件操作

sudo -u hdfs hadoop fs -rm -r -f /user/hive/warehouse/db名/表名/分区名

五、存储格式

1.Textfile

Hive数据表的默认格式，数据不做压缩，磁盘开销大，数据解析开销大。存储方式：行存储。

可以使用Gzip压缩算法，但压缩后的文件不支持split。

在反序列化过程中，必须逐个字符判断是不是分隔符和行结束符，因此反序列化开销会比SequenceFile高几十倍。

2.RCFile

存储方式：数据按行分块，每块按列存储。结合了行存储和列存储的优点：

首先，RCFile 保证同一行的数据位于同一节点，因此元组重构的开销很低。其次，像列存储一样，RCFile 能够利用列维度的数据压缩，并且能跳过不必要的列读取。

数据追加：RCFile不支持任意方式的数据写操作，仅提供一种追加接口，这是因为底层的 HDFS当前仅仅支持数据追加写文件尾部。

行组大小：行组变大有助于提高数据压缩的效率，但是可能会损害数据的读取性能，因为这样增加了 Lazy 解压性能的消耗。而且行组变大会占用更多的内存，这会影响并发执行的其他MR作业。考虑到存储空间和查询效率两个方面，Facebook 选择 4MB 作为默认的行组大小，当然也允许用户自行选择参数进行配置。

3.ORCFile

存储方式：数据按行分块，每块按照列存储。

压缩快，可切分，快速列存取。效率比Rcfile高，是Rcfile的改良版本。

支持各种复杂的数据类型，比如datetime,decimal,以及复杂的struct。

4.Parquet

Parquet能够很好的压缩，有很好的查询性能，支持有限的模式演进。但是写速度通常比较慢。这中文件格式主要是用在Cloudera Impala上面的。

六、大白话

Hive就是一个存储数据的库，你可以理解它是一个仓库，里面放了各种各样的东西，这个东西就是数据。多种存储格式是不同的算法设计的，底层有不同的执行方法。对应有不同的压缩比和反压缩比。

七、其他

下一篇：介绍存储引擎Kudu。

鸡汤：如果您心情不好，就回家躺几天。人生在世，开心最重要。做了决定不要后悔，一直向前走。我们唯一的目的就是活下去，然后活的好。

备注：以上资料来自网络，侵删。

大数据入门系列文章

走过路过不要错过，点赞走上人生巅峰。

大数据入门-三分钟读懂hadoop

最近在收集整理大数据入门文章，各位盆友关注点赞不迷路，每天都要开心鸭！大数据入门系列文章1.大数据入门-大数据是什么1.大数据入门-大数据是什么2.大数据入门-大数据技术概述(一)2.大数据入门-大数据技术概... 查看详情

stm32f103五分钟入门系列外部中断大汇总(代码片段)

学习板：STM32F103ZET6强推系列：STM32F103五分钟入门系列（一）跑马灯（库函数+寄存器）+加编程模板+GPIO总结STM32F103五分钟入门系列（二）GPIO的七大寄存器+GPIOx_LCKR作用和配置STM32F103五分... 查看详情

hive时间段为五分钟的统计(代码片段)

...容今天遇到了一个需求,需求就是时间段为5分钟的统计.有数据的时间戳.对成交单量进行统计.想法思路因为数据有时间戳,可以通过from_unixtime()来获取具体的时间.有了具体的时间,就可以用minute()函数获取对应数据所在的分钟.(minute... 查看详情

入门大数据---hive数据查询详解(代码片段)

Hive数据查询详解一、数据准备为了演示查询操作，这里需要预先创建三张表，并加载测试数据。数据文件emp.txt和dept.txt可以从本仓库的resources目录下载。1.1员工表--建表语句CREATETABLEemp(empnoINT,--员工表编号enameSTRING,--员工姓名jobST... 查看详情

大数据技术之hive(小白入门)(代码片段)

...hive简介Hive：由Facebook开源用于解决海量结构化日志的数据统计工具。Hive:是基于Hadoop的一个数据仓库工具，可以将结构化的数据文件映射为一张表，并提供类SQL查询功能。Hive安装1）下载hiveHive官网地址：http://... 查看详情

hive统计每五分钟交易量sql(代码片段)

最近单位组织大数据考试，有一道SQL题，题目如下已知：交易表（trade）交易表结构如下：trade_notrade_time100012022/8/2909:30:37100022022/8/2909:31:02100032022/8/2909:32:51……按照以下格式统计9：30以后每五分钟发生... 查看详情

数据仓库hive从入门到小牛(代码片段)

目录一、数据仓库的介绍1.1数据仓库的基本概念1.2数据仓库的主要特征1.3数据仓库与数据库区别1.4数据仓库分层架构1.5数据仓库之ETL二、Hive简介2.1什么是Hive?2.2为什么使用Hive?2.3Hive的体系结构2.4Hive与关系型数据库区别三、Hive的... 查看详情

hive从入门到实战五(代码片段)

第10章Hive实战之谷粒影音10.1需求描述统计硅谷影音视频网站的常规指标，各种TopN指标：统计视频观看数Top10统计视频类别热度Top10统计出视频观看数最高的20个视频的所属视频类别以及对应视频类别的个数统计视频观看数Top5... 查看详情

stm32f103五分钟入门系列（十五）输入捕获（精雕细琢-.-）(代码片段)

学习板：STM32F103ZET6参考：STM32F103五分钟入门系列（十二）定时器中断STM32F103五分钟入门系列（十五）输出比较（PWM输出）+各类测试STM32F103五分钟入门系列（五）按键实验（库函数+... 查看详情

stm32f103五分钟入门系列nvic中断优先级管理(代码片段)

实操|hive数据倾斜问题定位排查及解决(代码片段)

Hive数据倾斜怎么发现，怎么定位，怎么解决多数介绍数据倾斜的文章都是以大篇幅的理论为主，并没有给出具体的数据倾斜案例。当工作中遇到了倾斜问题，这些理论很难直接应用，导致我们面对倾斜时还是... 查看详情

stm32f103五分钟入门系列定时器中断(代码片段)

...中断（+数码管—24小时制钟表）STM32F103五分钟入门系列（八）SysTick滴答定时器+SysTick中断实现跑马灯STM32F103五分钟入门系列（十）NVIC中断优先级管查看详情

三分钟读懂摘要算法(代码片段)

摘要算法又称哈希算法，它表示输入任意长度的数据，输出固定长度的数据，相同的输入数据始终得到相同的输出，不同的输入数据尽量得到不同的输出。Java中的Object.hashCode()方法就是一个摘要算法，它可以输入任意数据，它的... 查看详情

十分钟带汝入门大数据开发语言scala(代码片段)

...面向对象编程和函数式编程的各种特性。目前最主流的大数据开发框架Spark的实现就是通过Scala去实现的。Scala可以与Java互操作。它用scalac这个编译器把源文件编译成Java的class文件（即在JVM上运行的字节码），也可以从Scala中调用... 查看详情

两个案例五分钟轻松入门harmony（鸿蒙）开发(代码片段)

...;JavaUI框架和JSUI框架。本文会通过Java和JS两种方式的Demo来入门HarmonyOS，此外也会介绍HarmonyOS的DevEco 查看详情

大数据之hive：hive调优全方位指南(代码片段)

目录一、HiveSQL语法二、Hive性能优化三、Hive性能优化之数据倾斜专题四、HiveSQL优化十二板斧五、Hive面试题(一)六、Hive/Hadoop高频面试点集合(二)本文基本涵盖以下内容：一、HiveSQL语法hive的DDL语法对数据库的操作创建数据库:cr... 查看详情

python数据分析pandas入门------十分钟入门pandas(代码片段)

Python数据分析基础一、导入常用库二、创建对象三、查看数据四、选取五、通过标签选取六、通过位置选取七、布尔索引八、赋值九、缺失值处理十、运算与统计十一、Apply函数的作用十二、频数统计十三、字符串方法十四、合... 查看详情

一分钟读懂低功耗蓝牙（ble)广播数据包(代码片段)

低功耗蓝牙=》BLE（BluetoothLowEnergy）怎样抓取BLE广播数据包硬件：一个BLE设备（具有广播功能）；一台HOLLONGBLESNIFFER软件：Hollong蓝牙4.0/4.1BLE协议监控分析仪软件下载链接：http://www.viewtool.com/index.php/22-2016-07-29-02-11-32/205-hollong-4-0-4-1... 查看详情