Greenplum 分布键 distribute hash分布和随机分布

  Greenplum是分布式系统,创建表时需要指定分布键,目的是为了数据能够平均分布到各个段,所以选择分布键十分重要,选择错了会导致数据不一致。 分布方式:
  • Hash分布:按分布键对数据列进行hash取模存放到对应的segment。
  • 随机分布:数据随机分布在数据库,每次查询都会查询所有的segment。
 

1.分布策略

(1)hash分布

  Greenplum默认使用hash分布策略。该策略可选一个或者多个列作为分布键(distribution key,简称DK)。分布键做哈希算法来确认数据存放到对应的segment上。相同分布键值会hash到相同的段上。表上最好有唯一键或者主键,这样能保证数据均衡分不到各个段上。   如果没有主键或者唯一键,默认选择第一列作为分布键 语法:
CREATE TABLE TEST(
id INT,
num INT,
data INT
)
distribute by id;
 

(2)随机分布

  数据被随机分布到段上,相同记录可能会存放在不同的段上。随机分布可以保证数据平均,但是Greenplum的没有跨节点的唯一键约束数据,所以无法保证数据唯一。基于唯一性和性能考虑,推荐使用hash分布。 语法:
CREATE TABLE TEST(
id INT,
num INT,
data INT
)
distribute by random;
 

2.分布键语法

(1)查看表的节点分布情况
select gp_segment_id,count(1) from 表名 group by 1 order by 1;
  (2)更改分布键 # 如果有主键存在,需要先删除主键关联
ALTER TABLE 表名 set distributed by(列名);
 
上一篇:实战分析!记录一次腾讯Java岗面试笔试总结,年薪50W


下一篇:ConcurrentHashMap的实现原理(JDK1.7和JDK1.8)