Role Overview
We are seeking seasoned professionals with deep expertise in operating and managing High-Performance Computing (HPC) platforms. The ideal candidate will have hands-on experience in designing, deploying, and maintaining HPC clusters, storage systems, and networking infrastructure, leveraging industry-leading tools and technologies.
Key Responsibilities
· HPC Infrastructure Management
o Operate and maintain HPC clusters based on CentOS, RHEL, and hardware platforms like HPE and NVIDIA DGX.
o Ensure optimal performance, scalability, and reliability of compute resources.
· Storage Administration
o Manage large-scale storage systems including Dell Isilon, VAST Storage, Lustre, and GPFS.
o Implement data lifecycle management and optimize storage performance for HPC workloads.
· Networking
o Configure and maintain InfiniBand-based networking for low-latency, high-bandwidth communication.
o Troubleshoot network performance issues and ensure secure connectivity.
· Cluster and Job Scheduling
o Administer cluster management tools such as Bright Cluster Manager, Altair Grid Manager, and IBM LSF.
o Optimize job scheduling and resource allocation for diverse workloads.
· Monitoring and Automation
o Implement monitoring solutions using Zabbix, Grafana, and ELK Stack.
o Automate provisioning and configuration using Cobbler, Chef, Ansible, and AWS ParallelCluster.
· Performance Tuning & Troubleshooting
o Conduct performance benchmarking and tuning for HPC workloads.
o Diagnose and resolve hardware/software issues across compute, storage, and network layers.
· Security & Compliance
o Ensure HPC environment adheres to security best practices and compliance standards.
Required Skills & Qualifications
· Technical Expertise
o Strong knowledge of Linux OS (CentOS, RHEL) and HPC hardware platforms (HPE, NVIDIA DGX).
o Hands-on experience with parallel file systems (Lustre, GPFS) and enterprise storage solutions.
o Proficiency in InfiniBand networking and high-speed interconnects.
o Familiarity with job schedulers and cluster management tools (IBM LSF, Bright Cluster Manager, Altair Grid Manager).
· Automation & Scripting
o Expertise in Ansible, Chef, Cobbler, and scripting languages (Bash, Python).
o Experience with AWS ParallelCluster or similar cloud-based HPC solutions.
· Monitoring & Logging
o Practical experience with Zabbix, Grafana, and ELK Stack for system health and performance monitoring.
· Soft Skills
o Strong problem-solving and analytical skills.
o Ability to work in a fast-paced environment and lead technical teams.
o Excellent communication and documentation skills.
Preferred Qualifications
· Exposure to AI/ML workloads on HPC clusters.
· Experience with containerization (Docker, Singularity) in HPC environments.
· Knowledge of security hardening for HPC systems.
Education
· Bachelor’s or Master’s degree in Computer Science, Engineering, or related field.
#LI-LK1
À propos de Cognizant
Cognizant (NASDAQ: CTSH) est un AI Builder et une entreprise de services numériques (ESN) élaborant des solutions complètes d’IA maximisant les investissements pour des résultats concrets. Sa profonde expertise des métiers, des processus et des technologies lui permet d’intégrer dans les systèmes technologiques le contexte unique de chaque organisation de l’ingénierie à la production à l’échelle. Son objectif: améliorer l’efficacité des équipes, créer de la valeur et permettre aux grandes entreprises de rester performantes dans un monde qui évolue rapidement. Pour en savoir plus: cognizant.ai ou @cognizant.
À savoir avant de postuler
- Autorisation de travail: Cognizant ne prendra en considération que les candidats à ce poste qui sont légalement autorisés à travailler au Canada sans avoir besoin d'un parrainage de l'employeur, aujourd'hui ou à l'avenir.
- Mesures d’adaptation: Si vous avez un handicap qui nécessite des mesures d’adaptation raisonnable pour effectuer une recherche d’emploi ou poser une candidature, veuillez envoyer un courriel à [email protected] avec votre demande et vos coordonnées.
- L’IA dans notre processus de recrutement: Nous utilisons des outils d'intelligence artificielle (IA) pour trier et évaluer les candidatures efficacement. Notre équipe examine ensuite les candidatures et décide qui passe à l’étape suivante.
- Poste à pourvoir: Sauf indication contraire, ce poste est actuellement vacant et nous cherchons à le pourvoir.
- Exigences linguistiques: Nous demandons à tous les candidats de posséder une connaissance de base de l’anglais afin de faciliter les communications internes. Pour les postes au Québec, la capacité à communiquer efficacement en anglais est requise car vous fournirez des services à et collaborerez avec des parties prenantes anglophones situées hors de la province.
- Inclusion: Cognizant est un employeur souscrivant au principe de l’égalité d’accès à l’emploi. Votre candidature et votre dossier ne seront pas examinés en fonction de la race, de la couleur, du sexe, de la religion, des croyances, de l'orientation sexuelle, de l'identité de genre, de l'origine nationale, du handicap, des renseignements génétiques, de la grossesse, du statut d'ancien combattant ou de toute autre caractéristique protégée par les lois fédérales, provinciales ou locales.











