在一些数据库系统中, bitmap 索引经常用来给一些具有大量重复值的字段建立索引。 布尔字段(性别)、状态编码等。
相比于使用正常的 B-Tree 索引, Bitmap 显示的非常高效。
PostgreSQL 并不支持bitmap索引, 但是使用GIN索引可以非常好的处理这种冗余度高的字段。GIN 索引的内部结构与bitmap
是非常相似的。它并不是使用bitmap作为索引项,但是在9.4版本中,它使用的是 varbyte 编码,在最好的情况下, 每一个索引
项只需要占用一个字节。之前是使用 2-3个字节用来存放索引项。在早期的版本,是使用6个字节来存放索引条目,但是这相比于
B-Tree 每个索引条目仍然具有非常小的开销。
创建一个表, 并使用一些字段用来填充它。
CREATE TABLE numbers (n int4, mod2 int4);
insert into numbers (n, mod2) select n, n%2 from generate_series(1, 10000000) n;
这里用到了扩展件 btree_gin, 下面为表创建 GIN 索引
create extension btree_gin;
create index numbers_mod2_gin_idx on numbers using gin(mod2);
对比实验, 我们为相同的列创建B-Tree 索引
create index numbers_mod2_btree_idx on numbers using btree (mod2);
检查建立的索引
di+
public | numbers_mod2_btree_idx | index | whatcat | numbers | 214 MB |
public | numbers_mod2_gin_idx | index | whatcat | numbers | 10 MB |
在这里我们可以看到, GIN 索引相比于 B-Tree 索引有20倍小。