hive中分区表和分桶表的区别

Hive将表划分为分区(partition)表和分桶(bucket)表。

  • 分区可以让数据的部分查询变得更快,也就是说,在加载数据的时候可以指定加载某一部分数据,并不是全量的数据。

  • 分桶表通常是在原始数据中加入一些额外的结构,这些结构可以用于高效的查询,例如,基于ID的分桶可以使得用户的查询非常的块。

  • 分区在HDFS上的表现形式是一个目录, 分桶是一个单独的文件

  • 分区: 细化数据管理,直接读对应目录,缩小mapreduce程序要扫描的数据量

  • 分桶:  
    1、提高join查询的效率(用分桶字段做连接字段)
    2、提高采样的效率

©著作权归作者所有,转载或内容合作请联系作者
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。