Hive的数据模型数据在Hive里组织成表,分区和桶的形式。表:Hive里的表类似于关系数据库中的表。每个表都有一个对应的HDFS目录。表中的数据被序列化后存储在该目录的文件中。Hive提供了内置的序列化格式。用户还可以通过自定义序列化和反序列化的方法去支持新的数据格式。每张表的序列化格式存储在原数据库中,并在查询编译和执行时被自动调用。Hive同时还支持数据存储在NFS,本地目录的外部表
数据在Hive里组织成表,分区和桶的形式 ◦ 表:Hive里的表类似于关系数据库中的表。每个表都有一个对应的 HDFS目录。表中的数据被序列化后存储在该目录的文件中。 Hive提供了内置的序列化格式。用户还可以通过自定义序列化 和反序列化的方法去支持新的数据格式。每张表的序列化格式 存储在原数据库中,并在查询编译和执行时被自动调用。Hive 同时还支持数据存储在NFS,本地目录的外部表
Hive的数据模型、数据在Hive里组织成表,分区和桶的形式。分区:分区是表的部分列的集合。一个表可以有一个或者多个分区,这些分区确定了数据在表自录下的分布情况。假设表T的数据是在/wh/T目录下。如果T在列ds和ctry上被分区,那么ds值为20090101和ctry值为US的数据将会被存储到/wh/T/ds=20090101/ctry=US的自录下。。桶:在每个分区中的数据可以根据列的哈希值进一步划分成桶,每个桶在分区自录下都存在一个文件中
数据在Hive里组织成表,分区和桶的形式 ◦ 分区:分区是表的部分列的集合。一个表可以有一个或者多个分区, 这些分区确定了数据在表目录下的分布情况。假设表T的数 据是在/wh/T目录下。如果T在列ds和ctry上被分区,那么 ds值为20090101和ctry值为US的数据将会被存储到 /wh/T/ds=20090101/ctry=US的目录下。 ◦ 桶:在每个分区中的数据可以根据列的哈希值进一步划分成桶,每 个桶在分区目录下都存在一个文件中