Hive和Hbase，

和通数据库htsjk.Com2019-11-08 23:09 来源:未知阅读:3020 评论 507 热度3

标签：

Hive和Hbase，

一、Hive是在Hadoop和hdfs上的数据仓库工具，提供类SQL语句HQL，并利用hdfs的map/reduce对存储在hdfs中的数据进行操纵。

二、hbase是一个列式数据库，也是利用Hadoop和hdfs系统的一个分布式数据库，它是非关系型数据库，但是与一般的非关系型数据库不采用表的结构不同，hbase也是以表位单位，但它是一个列式的。

三、hive的处理延迟很大，hbase主要用户实时处理数据。

四、

1.hbase与hive都是架构在hadoop之上的。都是用hadoop作为底层存储

2.Hive是建立在Hadoop之上为了减少MapReduce jobs编写工作的批处理系统，HBase是为了支持弥补Hadoop对实时操作的缺陷的项目。

3.想象你在操作RMDB数据库，如果是全表扫描，就用Hive+Hadoop,如果是索引访问，就用HBase+Hadoop 。
4.Hive query就是MapReduce jobs可以从5分钟到数小时不止，HBase是非常高效的，肯定比Hive高效的多。
5.Hive本身不存储和计算数据，它完全依赖于HDFS和MapReduce，Hive中的表纯逻辑。
6.hive借用hadoop的MapReduce来完成一些hive中的命令的执行
7.hbase是物理表，不是逻辑表，提供一个超大的内存hash表，搜索引擎通过它来存储索引，方便查询操作。
8.hbase是列存储。
9.hdfs作为底层存储，hdfs是存放文件的系统，而Hbase负责组织文件。
10.hive需要用到hdfs存储文件，需要用到MapReduce计算框架。

五、

Hive不支持常规的SQL更新语句，如：数据插入，更新，删除。因为其对数据的操作是针对整个数据表的。同时该特点也使得数据查询用时以数分钟甚至数小时来进行计算。此外，其MapReduce转换过程必须遵从预定义的转换规则。

HBase的数据查询是有一套属于自己类似SQL的操作语言的，这个需要一定的学习来掌握。此外，要运行HBase，ZooKeeper是需要配备的。ZooKeeper是一个针对大型分布式系统的可靠协调系统，提供的功能包括：配置维护、名字服务、分布式同步、组服务等。

应用举例

Hive适用于网络日志等数据量大、静态的数据查询。例如：用户消费行为记录，网站访问足迹等。但是不适用于联机实时在线查询的场合。

HBase能在大数据联机实时查询场合大展身手。例如：Fackbook就利用其对用户间的传送的消息进行联机实时分析。

小结

Hive与HBase两者是基于Hadoop上不同的技术。Hive是一种能执行MapReduce作业的类SQL编程接口，Hbase是一种非关系型的数据库结构。结合这两者自身的特点，互相结合使用或许能收到相得益彰的效果。例如：利用Hive处理静态离线数据，利用HBase进行联机实时查询，而后对两者间的结果集进行整合归并，从而使得数据完整且永葆青春，为进一步的商业分析提供良好支持。