99.998%인데, 좋은 숫자인데…→ 1년 동안 10분 장애
네이버 통합검색 10분 장애는 대재난!!!
!"#$%#&$%$'( =
*+,-
*++. + *+,-
평균 복구 시간
평균 무고장 시간
21.
서버 2 서버3 서버 4
서버 1
서버 5 서버 6 서버 7
서버 2 서버 3 서버 4
서버 1
서버 5 서버 6 서버 7
특정 서버에 문제가 생기면 다른 서버들이 많은 영향을 받는다!
22.
4L / 4L4L / 4L
+1L
3L / 4L 3L / 4L 3L / 4L
+1L+1L
2L / 4L 2L / 4L 2L / 4L 3L / 4L 3L / 4L
+1L+1L
한 친구가 죽으면 나머지 친구들은
몇 배를 받나
한 명이 현재 몇 배까지 받을 수 있나
부하증가배수 최대가용배수
버전 변경 시트래픽 양상 변화, 통계 무효화
조작 실수나 버그 유입 가능성
실제 사용자 트래픽이 아니지만 서비스에 영향을 줄 수 있음
지표 수집에 문제가 생겨서 거짓 경보가 발생하는 경우 많음
Mapping 정보에 문제가 생기거나 수집 자체가 잘 안되는 경우 등 원인은 매우 다양
59.
지금까지 겪어본 적없는 문제들
언제 어디서 어떻게 발생할지 모르는 Incident
모든 경우의 수를 다 자동화하거나 시스템화 하는 것은 불가능
SRE는 시스템이 안정적으로 돌아가게 만들기 위한 ‘모든’ 활동
개발자 / 엔지니어의 심리적, 정신적 안정감도 시스템의 Reliability 에 큰 영향을 줌
60.
일단, Incident 발생시 필요한 두 가지 역할 정의
•
•
•
•
•
•
Icons made by Freepik from www.flaticon.com
SREcon18 Americas “Incident Command for IT—What We've Learned from the Fire Department?” Brent Chapman
상황 판단
의사 결정
외부대화
지표 수집 / 정리
시간대별 상황 기록
Incident
감지
현재 시점
Icons made by Freepik from www.flaticon.com
66.
상황 판단
의사 결정
외부대화
지표 수집 / 정리
시간대별 상황 기록
Incident
감지
현재 시점
Chatbot 활용
Check in / Toss
Icons made by Freepik from www.flaticon.com
67.
SREcon18 Americas “YourSystem Has Recovered from an Incident, but Have Your Developers?” Jaime Woo
Incident 처리 후 많은 사람들이
분위기, 의욕, 집중력 등 각종 문제 경험
심리적 안전 (psychological safety) 의 중요성
의료계, 코미디, 스포츠 등 다른 분야 참고
각자 스트레스 처리하는 법 익히기
언제나 문제가 발생할 수 있다는 마음가짐
Incident에서 교훈 얻기
동료들의 도움의 중요성
68.
현실에서는 단순히 비난이없는 것 보다 사실에 기반하여 분석하는 것이 더 중요
글쓰기, 정기 Report 발행, 교육 등 SRE 문화 전파
NAVER Search & Tech
지진에도 흔들리지 않는 네이버 검색 시스템 - 1편
지진에도 흔들리지 않는 네이버 검색 시스템 - 2편
네이버 검색의 스마트한 경보 시스템
69.
비상 상황 대응방법 구체화
구성원 별 역할 체계화
SRE 조직 인원 보강
명 명 명 명
2015년 2016년 2017년 2018년 2019년
Anomaly Detection, Simulation 등
다양한 측면에서 발전을 위해 노력 중