Skip to content
Tuyển Dụng
← Công ty Cổ phần Thanh toán số MobiFone

Senior/Expert Incident Responder Platform 24/7 Team

Công ty Cổ phần Thanh toán số MobiFone · Hà Nội
Apply on official site ↗
Type
Full-time
Work mode
On-site
Level
Staff
Industry
Other
Salary
Thương lượng
Location
Quận Ba Đình, Hà Nội, Hà Nội

Overview

  • Giám sát và phát hiện sớm các dấu hiệu bất thường, sự cố trên hệ thống.
  • Phân tích, troubleshooting và khôi phục dịch vụ khi xảy ra sự cố.
  • Tham gia xử lý và điều phối các Major/Critical Incident, đảm bảo phản ứng và khôi phục theo SLA.
  • Phân tích nguyên nhân gốc rễ (RCA) và triển khai các biện pháp phòng ngừa tái diễn.
  • Phối hợp với các team Platform, DevOps, SRE, Application và các bên liên quan trong quá trình xử lý sự cố.
  • Liên tục cải thiện monitoring, alerting, automation và khả năng phục hồi của hệ thống.
  • 24/7 Incident Monitoring & Response
  • Tham gia trực vận hành và xử lý sự cố theo mô hình 24/7 Incident Response / On-call.
  • Theo dõi tình trạng hoạt động của hạ tầng, nền tảng và các dịch vụ dùng chung thông qua hệ thống monitoring/observability.
  • Tiếp nhận, phân loại và đánh giá mức độ nghiêm trọng, phạm vi ảnh hưởng của incident.
  • Trực tiếp troubleshooting và xử lý các sự cố liên quan đến Platform, Cloud, Container, Middleware và các dịch vụ dùng chung.
  • Thực hiện các biện pháp khôi phục dịch vụ nhanh chóng, giảm thiểu downtime và ảnh hưởng đến hệ thống/người dùng.
  • Tham gia xử lý và điều phối các Major Incident / Critical Incident, đảm bảo tiến độ và thông tin xử lý được cập nhật đầy đủ.
  • Thực hiện escalation tới các team chuyên môn khi incident vượt ngoài phạm vi xử lý.
  • Platform & Infrastructure Troubleshooting
  • Giám sát và xử lý sự cố trên các môi trường GCP và Private Cloud/Data Center.
  • Troubleshoot các nền tảng kỹ thuật dùng chung như Kong API Gateway, HashiCorp Vault, Temporal, Keycloak, GitLab và các middleware/platform services khác.
  • Phân tích các vấn đề liên quan đến availability, performance, resource utilization, connectivity và dependency giữa các hệ thống.
  • Phối hợp với Platform, DevOps, SRE, Application Engineering, Network, Security và các team liên quan để xử lý sự cố xuyên hệ thống.
  • Theo dõi incident đến khi dịch vụ được khôi phục ổn định và hoàn tất các bước xử lý sau incident.
  • Monitoring & Observability
  • Vận hành và khai thác các hệ thống monitoring, logging và observability như Splunk, ELK, Grafana, Prometheus, Zabbix, New Relic.
  • Phân tích metrics, logs, traces và alerts để phát hiện bất thường và xác định nguyên nhân sự cố.
  • Đánh giá chất lượng alert, phát hiện các cảnh báo thiếu hoặc chưa chính xác và đề xuất cải thiện.
  • Xây dựng/cải tiến dashboard, alert và monitoring nhằm nâng cao khả năng phát hiện sự cố sớm.
  • Theo dõi các chỉ số vận hành và xác định các dấu hiệu có nguy cơ dẫn đến incident.
  • Incident Investigation & RCA
  • Thực hiện điều tra sau sự cố, xác định Root Cause và Contributing Factors.
  • Tham gia thực hiện RCA, Post-Incident Review / Postmortem đối với các sự cố nghiêm trọng.
  • Phân tích recurring incident và các pattern bất thường để xác định các vấn đề mang tính hệ thống.
  • Đề xuất corrective/preventive actions nhằm giảm thiểu khả năng sự cố tái diễn.
  • Theo dõi việc thực hiện các action item sau incident và đánh giá hiệu quả của các biện pháp khắc phục.
  • Xây dựng và cập nhật Runbook, Troubleshooting Guide, Incident Playbook phục vụ vận hành 24/7.
  • Automation & Continuous Improvement
  • Tự động hóa các thao tác kiểm tra, chẩn đoán và khôi phục hệ thống nhằm rút ngắn MTTD/MTTR.
  • Sử dụng Python, Bash hoặc Go để xây dựng các script/tool hỗ trợ incident response và vận hành.
  • Đề xuất các cải tiến về monitoring, alerting, automation và operational process.
  • Phối hợp với Platform/DevOps/SRE để cải thiện system resiliency, fault tolerance và recoverability.
  • Tham gia xây dựng và cải tiến các tiêu chuẩn vận hành, quy trình escalation và cơ chế ứng phó sự cố.
  • Incident Coordination & Knowledge Sharing

Requirements

  • Tốt nghiệp Đại học chuyên ngành Công nghệ thông tin, Kỹ thuật phần mềm, Hệ thống thông tin hoặc các ngành liên quan.
  • Tối thiểu 03 năm kinh nghiệm trong các vị trí Incident Response, SRE, DevOps, Platform Engineer, System Engineer, Infrastructure Engineer hoặc tương đương.
  • Có kinh nghiệm thực tế trong môi trường Production System có yêu cầu cao về availability và reliability.
  • Có kinh nghiệm trực vận hành 24/7 và xử lý production incident là lợi thế.
  • Có kinh nghiệm troubleshooting và xử lý sự cố trên Cloud và/hoặc Data Center.
  • Có kinh nghiệm vận hành và troubleshooting trên GCP, AWS, Azure hoặc Private Cloud.
  • Có kinh nghiệm với một hoặc nhiều nền tảng như Kong API Gateway, HashiCorp Vault, Keycloak, Temporal, GitLab hoặc các hệ thống tương đương.
  • Có kinh nghiệm sử dụng các công cụ monitoring/observability như Splunk, ELK, Grafana, Prometheus, Zabbix, New Relic.
  • Có kiến thức tốt về Linux, Networking, HTTP/API, DNS, TCP/IP, Load Balancing và các thành phần hạ tầng phổ biến.
  • Có kinh nghiệm với Docker, Kubernetes và container orchestration.
  • Có khả năng đọc và phân tích logs, metrics, traces để troubleshooting.
  • Có khả năng scripting/programming bằng Python, Bash hoặc Go.
  • Hiểu về High Availability, Scalability, Fault Tolerance, Disaster Recovery và System Resilience.
  • Có kinh nghiệm thực hiện RCA / Postmortem và xây dựng action plan sau sự cố.
  • Tư duy phân tích và troubleshooting tốt, có khả năng nhanh chóng xác định vấn đề trong tình huống áp lực cao.
  • Chủ động, quyết đoán và có khả năng đưa ra phương án xử lý trong điều kiện thông tin chưa đầy đủ.
  • Có tinh thần ownership cao, theo sát incident đến khi dịch vụ được khôi phục ổn định.
  • Giao tiếp và phối hợp tốt với nhiều team trong quá trình xử lý Major/Critical Incident.
  • Sẵn sàng làm việc theo mô hình 24/7, On-call/Shift theo yêu cầu vận hành.
  • Có tinh thần học hỏi và liên tục cải thiện hệ thống, quy trình và năng lực xử lý sự cố.
  • Why You'll Love Working Here
  • Lương & Phụ cấp
  • Lương tháng 13, thưởng hiệu quả công việc năm (theo kết quả kinh doanh của công ty).
  • Phụ cấp ăn trưa: 730.000đ/tháng.
  • Phép năm: Tối đa 15 ngày/năm (theo cấp nhân sự).
  • Sức khỏe: Bảo hiểm xã hội, BH sức khỏe và khám sức khỏe định kỳ hàng năm.
  • Máy tính xách tay, màn hình và các phương tiện/tài khoản/công cụ cần thiết khác cho công việc.
  • Xét tăng lương hàng năm và cơ hội thăng tiến.
  • Công nhận và khen thưởng ở cấp độ nhóm và Công ty.
  • Môi trường làm việc trẻ trung, năng động và hợp tác.
  • Teambuilding hàng quý/ hàng năm & các sự kiện nội bộ gắn kết.

Benefits

InsuranceBonusSalary reviewHealthcareCompany tripsAllowancesLaptop / equipmentMeal allowance

Summary of facts from the official posting. View original ↗

Interested in this role?

You'll be taken to the employer's official application page.

Apply on official site ↗
Is this your business? Claim this page, request edits or removal
→