Greenplum是分布式系统,创建表时需要指定分布键,目的是为了数据能够平均分布到各个段,所以选择分布键十分重要,选择错了会导致数据不一致。
分布方式:
-
Hash分布:按分布键对数据列进行hash取模存放到对应的segment。
-
随机分布:数据随机分布在数据库,每次查询都会查询所有的segment。
1.分布策略
(1)hash分布
Greenplum默认使用hash分布策略。该策略可选一个或者多个列作为分布键(distribution key,简称DK)。分布键做哈希算法来确认数据存放到对应的segment上。相同分布键值会hash到相同的段上。表上最好有唯一键或者主键,这样能保证数据均衡分不到各个段上。
如果没有主键或者唯一键,默认选择第一列作为分布键
语法:
CREATE TABLE TEST(
id INT,
num INT,
data INT
)
distribute by id;
(2)随机分布
数据被随机分布到段上,相同记录可能会存放在不同的段上。随机分布可以保证数据平均,但是Greenplum的没有跨节点的唯一键约束数据,所以无法保证数据唯一。基于唯一性和性能考虑,推荐使用hash分布。
语法:
CREATE TABLE TEST(
id INT,
num INT,
data INT
)
distribute by random;
2.分布键语法
(1)查看表的节点分布情况
select gp_segment_id,count(1) from 表名 group by 1 order by 1;
(2)更改分布键
# 如果有主键存在,需要先删除主键关联
ALTER TABLE 表名 set distributed by(列名);