Hadoop框架:HDFS高可用环境配置

本文源码:GitHub·点这里 || GitEE·点这里

一、HDFS高可用

1、基础描述

在单点或者少数节点故障的情况下,集群还可以正常的提供服务,HDFS高可用机制可以通过配置Active/Standby两个NameNodes节点实现在集群中对NameNode的热备来消除单节点故障问题,如果单个节点出现故障,可通过该方式将NameNode快速切换到另外一个节点上。

2、机制详解

image

  • 基于两个NameNode做高可用,依赖共享Edits文件和Zookeeper集群;
  • 每个NameNode节点配置一个ZKfailover进程,负责监控所在NameNode节点状态;
  • NameNode与ZooKeeper集群维护一个持久会话;
  • 如果Active节点故障停机,ZooKeeper通知Standby状态的NameNode节点;
  • 在ZKfailover进程检测并确认故障节点无法工作后;
  • ZKfailover通知Standby状态的NameNode节点切换为Active状态继续服务;

ZooKeeper在大数据体系中非常重要,协调不同组件的工作,维护并传递数据,例如上述高可用下自动故障转移就依赖于ZooKeeper组件。

二、HDFS高可用

1、整体配置

服务列表 HDFS文件 YARN调度 单服务 共享文件 Zk集群
hop01 DataNode NodeManager NameNode JournalNode ZK-hop01
hop02 DataNode NodeManager ResourceManager JournalNode ZK-hop02
hop03 DataNode NodeManager SecondaryNameNode JournalNode ZK-hop03

2、配置JournalNode

创建目录

[[email protected] opt]# mkdir hopHA

拷贝Hadoop目录

cp -r /opt/hadoop2.7/ /opt/hopHA/

配置core-site.xml


    
    
        fs.defaultFS
           hdfs://mycluster
    
    
    
        hadoop.tmp.dir
       /opt/hopHA/hadoop2.7/data/tmp
    

配置hdfs-site.xml,添加内容如下



    dfs.nameservices
    mycluster




    dfs.ha.namenodes.mycluster
    nn1,nn2




    dfs.namenode.rpc-address.mycluster.nn1
    hop01:9000




    dfs.namenode.rpc-address.mycluster.nn2
    hop02:9000




    dfs.namenode.http-address.mycluster.nn1
    hop01:50070




    dfs.namenode.http-address.mycluster.nn2
    hop02:50070




    dfs.namenode.shared.edits.dir
    qjournal://hop01:8485;hop02:8485;hop03:8485/mycluster




    dfs.ha.fencing.methods
    sshfence




    dfs.ha.fencing.ssh.private-key-files
    /root/.ssh/id_rsa




    dfs.journalnode.edits.dir
    /opt/hopHA/hadoop2.7/data/jn




    dfs.permissions.enable
    false




    dfs.client.failover.proxy.provider.mycluster
    org.apache.hadoop.hdfs.server.namenode.ha.ConfiguredFailoverProxyProvider

依次启动journalnode服务

[[email protected] hadoop2.7]# pwd
/opt/hopHA/hadoop2.7
[[email protected] hadoop2.7]# sbin/hadoop-daemon.sh start journalnode

删除hopHA下数据

[[email protected] hadoop2.7]# rm -rf data/ logs/

NN1格式化并启动NameNode

[[email protected] hadoop2.7]# pwd
/opt/hopHA/hadoop2.7
bin/hdfs namenode -format
sbin/hadoop-daemon.sh start namenode

NN2同步NN1数据

[[email protected] hadoop2.7]# bin/hdfs namenode -bootstrapStandby

NN2启动NameNode

[[email protected] hadoop2.7]# sbin/hadoop-daemon.sh start namenode

查看当前状态

image

在NN1上启动全部DataNode

[[email protected] hadoop2.7]# sbin/hadoop-daemons.sh start datanode

NN1切换为Active状态

[[email protected] hadoop2.7]# bin/hdfs haadmin -transitionToActive nn1
[[email protected] hadoop2.7]# bin/hdfs haadmin -getServiceState nn1
active

image

3、故障转移配置

配置hdfs-site.xml,新增内容如下,同步集群


    dfs.ha.automatic-failover.enabled
    true

配置core-site.xml,新增内容如下,同步集群


    ha.zookeeper.quorum
    hop01:2181,hop02:2181,hop03:2181

关闭全部HDFS服务

[[email protected] hadoop2.7]# sbin/stop-dfs.sh

启动Zookeeper集群

/opt/zookeeper3.4/bin/zkServer.sh start

hop01初始化HA在Zookeeper中状态

[[email protected] hadoop2.7]# bin/hdfs zkfc -formatZK

hop01启动HDFS服务

[[email protected] hadoop2.7]# sbin/start-dfs.sh

NameNode节点启动ZKFailover

这里hop01和hop02先启动的服务状态就是Active,这里先启动hop02。

[hadoop2.7]# sbin/hadoop-daemon.sh start zkfc

image

结束hop02的NameNode进程

kill -9 14422

等待一下查看hop01状态

[[email protected] hadoop2.7]# bin/hdfs haadmin -getServiceState nn1
active

三、YARN高可用

1、基础描述

image

基本流程和思路与HDFS机制类似,依赖Zookeeper集群,当Active节点故障时,Standby节点会切换为Active状态持续服务。

2、配置详解

环境同样基于hop01和hop02来演示。

配置yarn-site.xml,同步集群下服务



    
        yarn.nodemanager.aux-services
        mapreduce_shuffle
    

    
    
        yarn.resourcemanager.ha.enabled
        true
    
 
    
    
        yarn.resourcemanager.cluster-id
        cluster-yarn01
    

    
        yarn.resourcemanager.ha.rm-ids
        rm1,rm2
    

    
        yarn.resourcemanager.hostname.rm1
        hop01
    

    
        yarn.resourcemanager.hostname.rm2
        hop02
    
 
     
    
        yarn.resourcemanager.zk-address
        hop01:2181,hop02:2181,hop03:2181
    

     
    
        yarn.resourcemanager.recovery.enabled
        true
    
 
     
    
        yarn.resourcemanager.store.class     org.apache.hadoop.yarn.server.resourcemanager.recovery.ZKRMStateStore
    

重启journalnode节点

sbin/hadoop-daemon.sh start journalnode

在NN1服务格式化并启动

[[email protected] hadoop2.7]# bin/hdfs namenode -format
[[email protected] hadoop2.7]# sbin/hadoop-daemon.sh start namenode

NN2上同步NN1元数据

[[email protected] hadoop2.7]# bin/hdfs namenode -bootstrapStandby

启动集群下DataNode

[[email protected] hadoop2.7]# sbin/hadoop-daemons.sh start datanode

NN1设置为Active状态

先启动hop01即可,然后启动hop02。

[[email protected] hadoop2.7]# sbin/hadoop-daemon.sh start zkfc

hop01启动yarn

[[email protected] hadoop2.7]# sbin/start-yarn.sh

hop02启动ResourceManager

[[email protected] hadoop2.7]# sbin/yarn-daemon.sh start resourcemanager

查看状态

[[email protected] hadoop2.7]# bin/yarn rmadmin -getServiceState rm1

image

四、源代码地址

GitHub·地址
https://github.com/cicadasmile/big-data-parent
GitEE·地址
https://gitee.com/cicadasmile/big-data-parent

推荐阅读:编程体系整理

序号 项目名称 GitHub地址 GitEE地址 推荐指数
01 Java描述设计模式,算法,数据结构 GitHub·点这里 GitEE·点这里 ☆☆☆☆☆
02 Java基础、并发、面向对象、Web开发 GitHub·点这里 GitEE·点这里 ☆☆☆☆
03 SpringCloud微服务基础组件案例详解 GitHub·点这里 GitEE·点这里 ☆☆☆
04 SpringCloud微服务架构实战综合案例 GitHub·点这里 GitEE·点这里 ☆☆☆☆☆
05 SpringBoot框架基础应用入门到进阶 GitHub·点这里 GitEE·点这里 ☆☆☆☆
06 SpringBoot框架整合开发常用中间件 GitHub·点这里 GitEE·点这里 ☆☆☆☆☆
07 数据管理、分布式、架构设计基础案例 GitHub·点这里 GitEE·点这里 ☆☆☆☆☆
08 大数据系列、存储、组件、计算等框架 GitHub·点这里 GitEE·点这里 ☆☆☆☆☆

你可能感兴趣的