← Công ty Cổ phần Thanh toán số MobiFone
Senior/Expert Incident Responder Platform 24/7 Team
Công ty Cổ phần Thanh toán số MobiFone · Hà Nội
Ứng tuyển tại trang chính thức ↗
Loại hình
Toàn thời gian
Hình thức
Tại văn phòng
Cấp bậc
Nhân viên
Ngành nghề
Ngành nghề khác
Mức lương
Thương lượng
Địa điểm
Quận Ba Đình, Hà Nội, Hà Nội
Tổng quan
- Giám sát và phát hiện sớm các dấu hiệu bất thường, sự cố trên hệ thống.
- Phân tích, troubleshooting và khôi phục dịch vụ khi xảy ra sự cố.
- Tham gia xử lý và điều phối các Major/Critical Incident, đảm bảo phản ứng và khôi phục theo SLA.
- Phân tích nguyên nhân gốc rễ (RCA) và triển khai các biện pháp phòng ngừa tái diễn.
- Phối hợp với các team Platform, DevOps, SRE, Application và các bên liên quan trong quá trình xử lý sự cố.
- Liên tục cải thiện monitoring, alerting, automation và khả năng phục hồi của hệ thống.
- 24/7 Incident Monitoring & Response
- Tham gia trực vận hành và xử lý sự cố theo mô hình 24/7 Incident Response / On-call.
- Theo dõi tình trạng hoạt động của hạ tầng, nền tảng và các dịch vụ dùng chung thông qua hệ thống monitoring/observability.
- Tiếp nhận, phân loại và đánh giá mức độ nghiêm trọng, phạm vi ảnh hưởng của incident.
- Trực tiếp troubleshooting và xử lý các sự cố liên quan đến Platform, Cloud, Container, Middleware và các dịch vụ dùng chung.
- Thực hiện các biện pháp khôi phục dịch vụ nhanh chóng, giảm thiểu downtime và ảnh hưởng đến hệ thống/người dùng.
- Tham gia xử lý và điều phối các Major Incident / Critical Incident, đảm bảo tiến độ và thông tin xử lý được cập nhật đầy đủ.
- Thực hiện escalation tới các team chuyên môn khi incident vượt ngoài phạm vi xử lý.
- Platform & Infrastructure Troubleshooting
- Giám sát và xử lý sự cố trên các môi trường GCP và Private Cloud/Data Center.
- Troubleshoot các nền tảng kỹ thuật dùng chung như Kong API Gateway, HashiCorp Vault, Temporal, Keycloak, GitLab và các middleware/platform services khác.
- Phân tích các vấn đề liên quan đến availability, performance, resource utilization, connectivity và dependency giữa các hệ thống.
- Phối hợp với Platform, DevOps, SRE, Application Engineering, Network, Security và các team liên quan để xử lý sự cố xuyên hệ thống.
- Theo dõi incident đến khi dịch vụ được khôi phục ổn định và hoàn tất các bước xử lý sau incident.
- Monitoring & Observability
- Vận hành và khai thác các hệ thống monitoring, logging và observability như Splunk, ELK, Grafana, Prometheus, Zabbix, New Relic.
- Phân tích metrics, logs, traces và alerts để phát hiện bất thường và xác định nguyên nhân sự cố.
- Đánh giá chất lượng alert, phát hiện các cảnh báo thiếu hoặc chưa chính xác và đề xuất cải thiện.
- Xây dựng/cải tiến dashboard, alert và monitoring nhằm nâng cao khả năng phát hiện sự cố sớm.
- Theo dõi các chỉ số vận hành và xác định các dấu hiệu có nguy cơ dẫn đến incident.
- Incident Investigation & RCA
- Thực hiện điều tra sau sự cố, xác định Root Cause và Contributing Factors.
- Tham gia thực hiện RCA, Post-Incident Review / Postmortem đối với các sự cố nghiêm trọng.
- Phân tích recurring incident và các pattern bất thường để xác định các vấn đề mang tính hệ thống.
- Đề xuất corrective/preventive actions nhằm giảm thiểu khả năng sự cố tái diễn.
- Theo dõi việc thực hiện các action item sau incident và đánh giá hiệu quả của các biện pháp khắc phục.
- Xây dựng và cập nhật Runbook, Troubleshooting Guide, Incident Playbook phục vụ vận hành 24/7.
- Automation & Continuous Improvement
- Tự động hóa các thao tác kiểm tra, chẩn đoán và khôi phục hệ thống nhằm rút ngắn MTTD/MTTR.
- Sử dụng Python, Bash hoặc Go để xây dựng các script/tool hỗ trợ incident response và vận hành.
- Đề xuất các cải tiến về monitoring, alerting, automation và operational process.
- Phối hợp với Platform/DevOps/SRE để cải thiện system resiliency, fault tolerance và recoverability.
- Tham gia xây dựng và cải tiến các tiêu chuẩn vận hành, quy trình escalation và cơ chế ứng phó sự cố.
- Incident Coordination & Knowledge Sharing
Yêu cầu
- Tốt nghiệp Đại học chuyên ngành Công nghệ thông tin, Kỹ thuật phần mềm, Hệ thống thông tin hoặc các ngành liên quan.
- Tối thiểu 03 năm kinh nghiệm trong các vị trí Incident Response, SRE, DevOps, Platform Engineer, System Engineer, Infrastructure Engineer hoặc tương đương.
- Có kinh nghiệm thực tế trong môi trường Production System có yêu cầu cao về availability và reliability.
- Có kinh nghiệm trực vận hành 24/7 và xử lý production incident là lợi thế.
- Có kinh nghiệm troubleshooting và xử lý sự cố trên Cloud và/hoặc Data Center.
- Có kinh nghiệm vận hành và troubleshooting trên GCP, AWS, Azure hoặc Private Cloud.
- Có kinh nghiệm với một hoặc nhiều nền tảng như Kong API Gateway, HashiCorp Vault, Keycloak, Temporal, GitLab hoặc các hệ thống tương đương.
- Có kinh nghiệm sử dụng các công cụ monitoring/observability như Splunk, ELK, Grafana, Prometheus, Zabbix, New Relic.
- Có kiến thức tốt về Linux, Networking, HTTP/API, DNS, TCP/IP, Load Balancing và các thành phần hạ tầng phổ biến.
- Có kinh nghiệm với Docker, Kubernetes và container orchestration.
- Có khả năng đọc và phân tích logs, metrics, traces để troubleshooting.
- Có khả năng scripting/programming bằng Python, Bash hoặc Go.
- Hiểu về High Availability, Scalability, Fault Tolerance, Disaster Recovery và System Resilience.
- Có kinh nghiệm thực hiện RCA / Postmortem và xây dựng action plan sau sự cố.
- Tư duy phân tích và troubleshooting tốt, có khả năng nhanh chóng xác định vấn đề trong tình huống áp lực cao.
- Chủ động, quyết đoán và có khả năng đưa ra phương án xử lý trong điều kiện thông tin chưa đầy đủ.
- Có tinh thần ownership cao, theo sát incident đến khi dịch vụ được khôi phục ổn định.
- Giao tiếp và phối hợp tốt với nhiều team trong quá trình xử lý Major/Critical Incident.
- Sẵn sàng làm việc theo mô hình 24/7, On-call/Shift theo yêu cầu vận hành.
- Có tinh thần học hỏi và liên tục cải thiện hệ thống, quy trình và năng lực xử lý sự cố.
- Why You'll Love Working Here
- Lương & Phụ cấp
- Lương tháng 13, thưởng hiệu quả công việc năm (theo kết quả kinh doanh của công ty).
- Phụ cấp ăn trưa: 730.000đ/tháng.
- Phép năm: Tối đa 15 ngày/năm (theo cấp nhân sự).
- Sức khỏe: Bảo hiểm xã hội, BH sức khỏe và khám sức khỏe định kỳ hàng năm.
- Máy tính xách tay, màn hình và các phương tiện/tài khoản/công cụ cần thiết khác cho công việc.
- Xét tăng lương hàng năm và cơ hội thăng tiến.
- Công nhận và khen thưởng ở cấp độ nhóm và Công ty.
- Môi trường làm việc trẻ trung, năng động và hợp tác.
- Teambuilding hàng quý/ hàng năm & các sự kiện nội bộ gắn kết.
Quyền lợi
Chế độ bảo hiểmChế độ thưởngTăng lươngChăm sóc sức khỏeDu lịchPhụ cấpLaptop / Thiết bịPhụ cấp ăn trưa
Tóm tắt thông tin từ tin tuyển dụng chính thức. Xem bản gốc ↗
Quan tâm đến vị trí này?
Bạn sẽ được chuyển đến trang ứng tuyển chính thức của nhà tuyển dụng.
Ứng tuyển tại trang chính thức ↗
Đây là doanh nghiệp của bạn?
Nhận quản lý trang, yêu cầu chỉnh sửa hoặc gỡ bỏ
→