Site Reliability Engineer
CÔNG TY CỔ PHẦN ĐẦU TƯ CÔNG NGHỆ & ĐỔI MỚI VIỆT
Mô tả công việc
Vận hành & đảm bảo độ tin cậy hệ thống Tham gia triển khai, vận hành và hỗ trợ tối ưu hạ tầng phục vụ các hệ thống production, dưới sự hướng dẫn của Lead/Senior.. Theo dõi, giám sát các chỉ số vận hành của hệ thống, hỗ trợ đảm bảo đáp ứng SLA/SLO. Phối hợp với Developer, QA, Security và các bộ phận liên quan để nâng cao độ ổn định, khả năng mở rộng và bảo mật hệ thống. Tham gia xử lý sự cố production, hỗ trợ phân tích nguyên nhân (Root Cause Analysis) và đề xuất giải pháp phòng ngừa dưới sự hướng dẫn của SRE Lead/Senior. Cloud Native & Kubernetes Tham gia vận hành Kubernetes cluster trên môi trường On-premise và Cloud, từng bước làm quen với vận hành production. Hỗ trợ tối ưu hiệu năng, tài nguyên và khả năng mở rộng của hệ thống containerized. Tìm hiểu và tham gia triển khai các giải pháp High Availability (HA), Backup/Restore và Disaster Recovery (DR) cùng đội ngũ. Automation & Infrastructure as Code Học và áp dụng automation cho hạ tầng, quy trình vận hành bằng Terraform, Ansible. Tham gia xây dựng, tối ưu CI/CD pipeline phục vụ việc triển khai ứng dụng ổn định, tin cậy và an toàn. Hỗ trợ chuẩn hóa quy trình triển khai, cấu hình và vận hành hệ thống. Monitoring & Observability Tham gia xây dựng, vận hành hệ thống monitoring, logging và alerting tập trung. Phân tích metric, log, trace cơ bản để phát hiện và hỗ trợ xử lý các vấn đề hệ thống. Từng bước tìm hiểu và cải thiện khả năng observability cho các hệ thống microservices. Nghiên cứu & cải tiến Đề xuất các ý tưởng, giải pháp kỹ thuật nhằm nâng cao reliability, performance, automation và security. Chủ động học hỏi, chia sẻ kiến thức và tham gia cải tiến quy trình vận hành cùng team.
Yêu cầu công việc
Kinh nghiệm Tối thiểu 03 năm kinh nghiệm ở vị trí Dev Backend, System Admin, DevOps/SRE hoặc tương đương. Có kinh nghiệm làm việc với hệ thống production, hoặc từng tự tìm hiểu/triển khai Docker, Kubernetes, CI/CD (dự án cá nhân/học tập) là lợi thế. Ưu tiên ứng viên từng tham gia hỗ trợ vận hành, trực on-call hoặc xử lý sự cố, dù ở vai trò Dev hay Ops. Kiến thức & kỹ năng chuyên môn Hệ điều hành & Networking Có kiến thức cơ bản vững chắc về Linux (Ubuntu/CentOS/RHEL), quen thuộc với môi trường Command. Hiểu các khái niệm nền tảng về networking: TCP/IP, DNS, HTTP/HTTPS, Load Balancer, Reverse Proxy. Container & Cloud Native Có kiến thức và một số kinh nghiệm thực tế với Docker/Kubernetes (dự án cá nhân, môi trường học tập hoặc production đều được xem xét). Hiểu các khái niệm cơ bản về container runtime, ingress, autoscaling là lợi thế. Automation & CI/CD Có kiến thức nền tảng về Infrastructure as Code (Terraform, Ansible hoặc tương đương) và sẵn sàng học sâu hơn. Có kinh nghiệm hoặc từng tìm hiểu xây dựng CI/CD pipeline bằng GitLab CI, Jenkins, ArgoCD hoặc tương đương. Monitoring & Observability Có kiến thức cơ bản hoặc từng sử dụng Prometheus, Grafana, ELK/Loki hoặc các giải pháp monitoring/logging phân tán. Programming/Scripting Có nền tảng lập trình vững (Java, Python, Go, Node.js...), có khả năng đọc hiểu code và debug ứng dụng; có khả năng scripting bằng Bash/Python. Có kinh nghiệm phát triển ứng dụng chạy trên Golang là lợi thế lớn. Khác Có hiểu biết cơ bản về mô hình microservices và các vấn đề trong vận hành distributed systems là lợi thế (không bắt buộc). Tố chất cá nhân Tư duy phân tích, ham học hỏi và mong muốn giải quyết vấn đề. Chủ động, có tinh thần ownership, sẵn sàng nhận việc và học hỏi từ đội ngũ Senior. Khả năng làm việc nhóm và phối hợp liên phòng ban hiệu quả. Sẵn sàng học hỏi công nghệ mới, không ngại chuyển hướng từ Dev sang vận hành hệ thống (DevOps/SRE).
Quyền lợi
Thu nhập cạnh tranh, thưởng theo hiệu quả công việc và xét tăng lương định kỳ. Được đào tạo chuyên môn, hỗ trợ chi phí thi các chứng chỉ quốc tế (AWS, CKA, RHCSA, VMware...). Tham gia đầy đủ BHXH, BHYT, BHTN, khám sức khỏe định kỳ và các chế độ phúc lợi theo quy định của công ty. Môi trường làm việc chuyên nghiệp với cơ hội tham gia các dự án Cloud quy mô lớn, lộ trình phát triển nghề nghiệp rõ ràng