Agenda
NameNode HA 化の必要性
NameNodeHA 化前後の比較
NameNode HA 全体構成図
NameNode HA 構成の動き
Hadoopクラスタ全体構成図
NameNode HA に関する設定項目
NameNode HA 化前提条件
NameNode HA化手順
12.
NameNode HA 化前提条件
今回は、以下を前提条件としてNameNode HA化を実施
- HDPバージョン:2.4.2
- Ambariバージョン:2.5.2
- Ambariにて、以下の構成でHadoopクラスタ構築済み
Active NN ResourceManager
JobHistoryServer
Master
・DataNode
・NodeManager
Slave
Ambari
Server
MySQL
管理系
Secondary NN
13.
Agenda
NameNode HA 化の必要性
NameNodeHA 化前後の比較
NameNode HA 全体構成図
NameNode HA 構成の動き
Hadoopクラスタ全体構成図
NameNode HA に関する設定項目
NameNode HA 化前提条件
NameNode HA化手順
NameNode HA構成の動き(F/O時)
ZK1 ZK2ZK3
NameNode
(Active)
ZKFC
NameNode
(Standby
⇒ ⑥ Active)
NameNode#1 NameNode#2
ヘルスチェックヘルスチェック
⇒ SERVICE_NOT_RESPONDING
セッション管理
Active 選出
セッション管理
Active 選出
ActiveStandbyElector
HealthMonitor
ZKFC
ActiveStandbyElector
HealthMonitor
/Hadoop-ha
③一時znode ④一時znode
⑤永続znode
①ActiveであるNameNode#1のプロセスがダウン
②ZKとのセッションが消える
③NameNode#1が作成した一時znodeが消滅
④StandbyであるNameNode#2は一時znodeの作成を試み、成功するとActiveになる権利を得る
⑤NameNode#2は自分が最新のActiveであることを示すため永続znodeの情報を書き換える
⑥NameNode#2がActiveになる
①
②
36.
NameNode HA構成の動き(F/O時)
ZK1 ZK2ZK3
NameNode
(Active)
ZKFC
NameNode
(Standby
⇒ Active)
NameNode#1(192.168.1.1) NameNode#2(192.168.1.2)
ヘルスチェックヘルスチェック
⇒ SERVICE_HEALTHY
セッション管理
Active 選出
セッション管理
Active 選出
ActiveStandbyElector
HealthMonitor
ZKFC
ActiveStandbyElector
HealthMonitor
/Hadoop-ha
②一時znode ③一時znode
永続znode
①
万が一、Active NameNodeの状態が正常なのに、ZKとのセッションが切れてしまったら?
①何らかの理由でZKとのセッションが切れた
②NameNode#1が作成した一時znodeが消滅
③StandbyであるNameNode#2は一時znodeの作成を試み、成功するとActiveになる権利を得る
⇒ Active が 2つ = Split Brain の発生?
これを防ぐために NameNode#2 は Active になる前に永続znode の情報を読み込み、誰が今まで Active
だったかをチェックし、今まで Active だった ノード(NameNode#1) に対してフェンスを行う
37.
NameNode HA構成の動き(F/O時)
一時znode 一時znode
永続znode← 情報書換
ZK1 ZK2 ZK3
NameNode
(Active)
ZKFC
NameNode
(Active)
ZKFC
Master-201 Master-202
⑤ヘルスチェック
状態切り替え
⑤ヘルスチェック
⇒ SERVICE_HEALTHY
⑥セッション管理
⑦Active NN 選出
⑥セッション管理
⑦Active NN 選出hadoop-hdfs-zkfc-[NameNode#2].logより抜粋
フェンスが必要な古いActiveをチェック
ha.ActiveStandbyElector - Checking for any old active which needs to be fenced...
ha.ActiveStandbyElector - Old node exists:
0a0a4e616d654e6f6465484112036e6e321a0e4d61737465722d3230322e636f6d20d43e28d33e
ha.ZKFailoverController - Should fence: NameNode at [NameNode#1]/192.168.1.1:802
フェンス処理実施
ha.NodeFencer - ====== Beginning Service Fencing Process... ======
ha.NodeFencer - Trying method 1/1: org.apache.hadoop.ha.ShellCommandFencer(/bin/true)
ha.NodeFencer - ====== Fencing successful by method
org.apache.hadoop.ha.ShellCommandFencer(/bin/true) ======
フェンス成功後、永続znodeを書き換えActiveへ
ha.ActiveStandbyElector - Writing znode /hadoop-ha/[nameserviec ID]/ActiveBreadCrumb to indicate
that the local node is the most recent active...
ha.ZKFailoverController - Trying to make NameNode at [NameNode#2]/192.168.1.2:8020 active...
ha.ZKFailoverController - Successfully transitioned NameNode at [NameNode#2]/192.168.1.2:8020 to
active state
⇒ 上記の動きによりActiveは必ず1つとなる
NameNode HA構成の動き
Master-202
NameNode
(Active) Quorum
JournalManager
Journal
Node1
NameNode
(Active)Quorum
JournalManager
②edits書き込み
Master-201 ①NW的に完全に分離
Journal
Node2
Journal
Node3
②edits 書き込み
edits
最新エポック番号③
エポック番号②エポック番号③
hadoop-hdfs-journalnode-[NameNode#1].log より抜粋 (意図的にF/O、F/Bを繰り替えした際)
INFO server.Journal - Updating lastWriterEpoch from 0 to 1 for client /192.168.1.1
INFO server.Journal - Updating lastWriterEpoch from 1 to 2 for client /192.168.1.2
INFO server.Journal - Updating lastWriterEpoch from 2 to 3 for client /192.168.1.1
INFO server.Journal - Updating lastWriterEpoch from 3 to 4 for client /192.168.1.2
INFO server.Journal - Updating lastWriterEpoch from 4 to 5 for client /192.168.1.1
INFO server.Journal - Updating lastWriterEpoch from 5 to 6 for client /192.168.1.2
INFO server.Journal - Updating lastWriterEpoch from 6 to 7 for client /192.168.1.1
/hadoop/hdfs/journal/[nameservice ID]/current/last-promised-epoch にて確認
# cat last-promised-epoch
7
⇒ JournalNodeは最新のエポック番号情報を保持している