About the role
Szukamy doświadczonego inżyniera Linux/SRE do zespołu zajmującego się utrzymaniem i rozwojem infrastruktury HPC oraz klastrów GPU wykorzystywanych do AI.
Pracujemy na fizycznych serwerach, z Linuxem, sieciami Data Center i technologiami NVIDIA. Dużo automatyzujemy, korzystamy z Ansible, Pythona, Basha i Gita.
To nie jest typowa praca DevOps skupiona na chmurze i wdrażaniu aplikacji. Tutaj zdecydowanie więcej czasu spędza się na pracy z infrastrukturą, diagnozowaniu problemów i dbaniu o stabilność środowiska.
Mile widziane
* Doświadczenie z HPC, klastrami obliczeniowymi lub infrastrukturą GPU. * Znajomość technologii NVIDIA (Cumulus, DCGM, NCCL, NHC, NVIDIA Container Toolkit). * Znajomość InfiniBand, RDMA, SLURM. * Doświadczenie z Prometheus, Grafana, GitLab CI/CD. * Doświadczenie z rozproszonymi i klastrowymi systemami plików (Lustre, Ceph).
Kim jesteś (Soft Skills)?
* Potrafisz samodzielnie podejść do problemu i nie boisz się szukać rozwiązań. * Lubisz współpracować z innymi i potrafisz jasno komunikować, co robisz. * Bierzesz odpowiedzialność za swoją pracę i zmiany wprowadzane na produkcji. * Chętnie automatyzujesz powtarzalne zadania. * Nie masz problemu z pytaniem o pomoc ani dzieleniem się własną wiedzą.
Organizacja pracy
* Około 10-osobowy zespół podzielony na część operacyjną (SRE) i projektową. * Godziny pracy 8:00–18:00, z dwugodzinną przerwą. * Praca na Linuxie lub macOS. * Scrum, regularne spotkania i dużo bezpośredniej komunikacji w zespole. * Obecnie bez dyżurów nocnych i weekendowych, ale w przyszłości planowane jest wprowadzenie rotacyjnego on-call.
Co oferujemy?
* Pracę z dużymi klastrami GPU i infrastrukturą AI/HPC. * Sporo samodzielności i realny wpływ na to, jak działa infrastruktura. * Bezpośrednią współpracę z doświadczonymi inżynierami i Tech Leadem. * Możliwość poznania i rozwijania się w technologiach HPC/AI GPU. * Krótką ścieżkę decyzyjną, bez zbędnych formalności.
Find more English Speaking Jobs in France on Arbeitnow