← Công ty Cổ phần Thanh toán số MobiFone
Senior/Expert Incident Responder Platform 24/7 Team
Công ty Cổ phần Thanh toán số MobiFone · Hà Nội
Apply on official site ↗
Type
Full-time
Work mode
On-site
Level
Staff
Industry
Other
Salary
Thương lượng
Location
Quận Ba Đình, Hà Nội, Hà Nội
Overview
- Giám sát và phát hiện sớm các dấu hiệu bất thường, sự cố trên hệ thống.
- Phân tích, troubleshooting và khôi phục dịch vụ khi xảy ra sự cố.
- Tham gia xử lý và điều phối các Major/Critical Incident, đảm bảo phản ứng và khôi phục theo SLA.
- Phân tích nguyên nhân gốc rễ (RCA) và triển khai các biện pháp phòng ngừa tái diễn.
- Phối hợp với các team Platform, DevOps, SRE, Application và các bên liên quan trong quá trình xử lý sự cố.
- Liên tục cải thiện monitoring, alerting, automation và khả năng phục hồi của hệ thống.
- 24/7 Incident Monitoring & Response
- Tham gia trực vận hành và xử lý sự cố theo mô hình 24/7 Incident Response / On-call.
- Theo dõi tình trạng hoạt động của hạ tầng, nền tảng và các dịch vụ dùng chung thông qua hệ thống monitoring/observability.
- Tiếp nhận, phân loại và đánh giá mức độ nghiêm trọng, phạm vi ảnh hưởng của incident.
- Trực tiếp troubleshooting và xử lý các sự cố liên quan đến Platform, Cloud, Container, Middleware và các dịch vụ dùng chung.
- Thực hiện các biện pháp khôi phục dịch vụ nhanh chóng, giảm thiểu downtime và ảnh hưởng đến hệ thống/người dùng.
- Tham gia xử lý và điều phối các Major Incident / Critical Incident, đảm bảo tiến độ và thông tin xử lý được cập nhật đầy đủ.
- Thực hiện escalation tới các team chuyên môn khi incident vượt ngoài phạm vi xử lý.
- Platform & Infrastructure Troubleshooting
- Giám sát và xử lý sự cố trên các môi trường GCP và Private Cloud/Data Center.
- Troubleshoot các nền tảng kỹ thuật dùng chung như Kong API Gateway, HashiCorp Vault, Temporal, Keycloak, GitLab và các middleware/platform services khác.
- Phân tích các vấn đề liên quan đến availability, performance, resource utilization, connectivity và dependency giữa các hệ thống.
- Phối hợp với Platform, DevOps, SRE, Application Engineering, Network, Security và các team liên quan để xử lý sự cố xuyên hệ thống.
- Theo dõi incident đến khi dịch vụ được khôi phục ổn định và hoàn tất các bước xử lý sau incident.
- Monitoring & Observability
- Vận hành và khai thác các hệ thống monitoring, logging và observability như Splunk, ELK, Grafana, Prometheus, Zabbix, New Relic.
- Phân tích metrics, logs, traces và alerts để phát hiện bất thường và xác định nguyên nhân sự cố.
- Đánh giá chất lượng alert, phát hiện các cảnh báo thiếu hoặc chưa chính xác và đề xuất cải thiện.
- Xây dựng/cải tiến dashboard, alert và monitoring nhằm nâng cao khả năng phát hiện sự cố sớm.
- Theo dõi các chỉ số vận hành và xác định các dấu hiệu có nguy cơ dẫn đến incident.
- Incident Investigation & RCA
- Thực hiện điều tra sau sự cố, xác định Root Cause và Contributing Factors.
- Tham gia thực hiện RCA, Post-Incident Review / Postmortem đối với các sự cố nghiêm trọng.
- Phân tích recurring incident và các pattern bất thường để xác định các vấn đề mang tính hệ thống.
- Đề xuất corrective/preventive actions nhằm giảm thiểu khả năng sự cố tái diễn.
- Theo dõi việc thực hiện các action item sau incident và đánh giá hiệu quả của các biện pháp khắc phục.
- Xây dựng và cập nhật Runbook, Troubleshooting Guide, Incident Playbook phục vụ vận hành 24/7.
- Automation & Continuous Improvement
- Tự động hóa các thao tác kiểm tra, chẩn đoán và khôi phục hệ thống nhằm rút ngắn MTTD/MTTR.
- Sử dụng Python, Bash hoặc Go để xây dựng các script/tool hỗ trợ incident response và vận hành.
- Đề xuất các cải tiến về monitoring, alerting, automation và operational process.
- Phối hợp với Platform/DevOps/SRE để cải thiện system resiliency, fault tolerance và recoverability.
- Tham gia xây dựng và cải tiến các tiêu chuẩn vận hành, quy trình escalation và cơ chế ứng phó sự cố.
- Incident Coordination & Knowledge Sharing
Requirements
- Tốt nghiệp Đại học chuyên ngành Công nghệ thông tin, Kỹ thuật phần mềm, Hệ thống thông tin hoặc các ngành liên quan.
- Tối thiểu 03 năm kinh nghiệm trong các vị trí Incident Response, SRE, DevOps, Platform Engineer, System Engineer, Infrastructure Engineer hoặc tương đương.
- Có kinh nghiệm thực tế trong môi trường Production System có yêu cầu cao về availability và reliability.
- Có kinh nghiệm trực vận hành 24/7 và xử lý production incident là lợi thế.
- Có kinh nghiệm troubleshooting và xử lý sự cố trên Cloud và/hoặc Data Center.
- Có kinh nghiệm vận hành và troubleshooting trên GCP, AWS, Azure hoặc Private Cloud.
- Có kinh nghiệm với một hoặc nhiều nền tảng như Kong API Gateway, HashiCorp Vault, Keycloak, Temporal, GitLab hoặc các hệ thống tương đương.
- Có kinh nghiệm sử dụng các công cụ monitoring/observability như Splunk, ELK, Grafana, Prometheus, Zabbix, New Relic.
- Có kiến thức tốt về Linux, Networking, HTTP/API, DNS, TCP/IP, Load Balancing và các thành phần hạ tầng phổ biến.
- Có kinh nghiệm với Docker, Kubernetes và container orchestration.
- Có khả năng đọc và phân tích logs, metrics, traces để troubleshooting.
- Có khả năng scripting/programming bằng Python, Bash hoặc Go.
- Hiểu về High Availability, Scalability, Fault Tolerance, Disaster Recovery và System Resilience.
- Có kinh nghiệm thực hiện RCA / Postmortem và xây dựng action plan sau sự cố.
- Tư duy phân tích và troubleshooting tốt, có khả năng nhanh chóng xác định vấn đề trong tình huống áp lực cao.
- Chủ động, quyết đoán và có khả năng đưa ra phương án xử lý trong điều kiện thông tin chưa đầy đủ.
- Có tinh thần ownership cao, theo sát incident đến khi dịch vụ được khôi phục ổn định.
- Giao tiếp và phối hợp tốt với nhiều team trong quá trình xử lý Major/Critical Incident.
- Sẵn sàng làm việc theo mô hình 24/7, On-call/Shift theo yêu cầu vận hành.
- Có tinh thần học hỏi và liên tục cải thiện hệ thống, quy trình và năng lực xử lý sự cố.
- Why You'll Love Working Here
- Lương & Phụ cấp
- Lương tháng 13, thưởng hiệu quả công việc năm (theo kết quả kinh doanh của công ty).
- Phụ cấp ăn trưa: 730.000đ/tháng.
- Phép năm: Tối đa 15 ngày/năm (theo cấp nhân sự).
- Sức khỏe: Bảo hiểm xã hội, BH sức khỏe và khám sức khỏe định kỳ hàng năm.
- Máy tính xách tay, màn hình và các phương tiện/tài khoản/công cụ cần thiết khác cho công việc.
- Xét tăng lương hàng năm và cơ hội thăng tiến.
- Công nhận và khen thưởng ở cấp độ nhóm và Công ty.
- Môi trường làm việc trẻ trung, năng động và hợp tác.
- Teambuilding hàng quý/ hàng năm & các sự kiện nội bộ gắn kết.
Benefits
InsuranceBonusSalary reviewHealthcareCompany tripsAllowancesLaptop / equipmentMeal allowance
Summary of facts from the official posting. View original ↗
Interested in this role?
You'll be taken to the employer's official application page.
Apply on official site ↗
Is this your business?
Claim this page, request edits or removal
→