登录注册写文章

hive中分区表和分桶表的区别

bigdata张凯翔

hive中分区表和分桶表的区别

Hive将表划分为分区(partition)表和分桶(bucket)表。

分区可以让数据的部分查询变得更快，也就是说，在加载数据的时候可以指定加载某一部分数据，并不是全量的数据。
分桶表通常是在原始数据中加入一些额外的结构，这些结构可以用于高效的查询，例如，基于ID的分桶可以使得用户的查询非常的块。
分区在HDFS上的表现形式是一个目录，分桶是一个单独的文件
分区: 细化数据管理，直接读对应目录，缩小mapreduce程序要扫描的数据量
分桶：　
1、提高join查询的效率（用分桶字段做连接字段）
2、提高采样的效率

©著作权归作者所有,转载或内容合作请联系作者
平台声明：文章内容（如有图片或视频亦包括在内）由作者上传并发布，文章内容仅代表作者本人观点，简书系信息发布平台，仅提供信息存储服务。

赞1赞

赞赏

手机看全文