Hadoop 集群搭建之机器选购

两个概念:

  • IO受限
在从硬盘或者网络读取数据时遇到瓶颈
  • CPU受限
处理数据时遇到瓶颈
  • 带宽受限
写入数据网络带宽不够,导致无法实施传递数据

常见业务划分

  • 硬盘容量敏感型业务
    这类业务对读写延迟以及吞吐量都没有很大的要求,唯一的需要就是硬盘容量。比如大多数离线读写分析业务,上层应用一般每隔一段时间批量写入大量数据,然后读取也是定期批量读取大量数据。特点:离线写、离线读,需求硬盘容量
  • 带宽敏感型业务

    这类业务大多数写入吞吐量很大,但对读取吞吐量没有什么要求。比如日志实时存储业务,上层应用通过kafka将海量日志实时传输过来,要求能够实时写入,而读取场景一般是离线分析或者在上次业务遇到异常的时候对日志进行检索。特点:在线写、离线读,需求带宽

  • IO敏感型业务

    相比前面两类业务来说,IO敏感型业务一般都是较为核心的业务。这类业务对读写延迟要求较高,尤其对于读取延迟通常在100ms以内,部分业务可能要求更高。比如在线消息存储系统、历史订单系统、实时推荐系统等。特点:在(离)线写、在线读,需求内存、高IOPS介质

二:内存需要

1. 高峰值计算:
1)假设高峰期有10W个用户,每个用户每秒产生一条数据,一年的数据量是10W*3600*24*365=3 W亿条
2)假设每条数据200大小,总需内存为600万亿B=573T

二:各项硬件及意义

1.CPU
2.磁盘
3.
上一篇:shiro


下一篇:我的博客即将入驻“云栖社区”,诚邀技术同仁一同入驻。