Чем предстоит заниматься:
- Участвовать в разворачивании HPC кластера для задач ML/AI с нуля;
- Заниматься сопровождением и развитием высокопроизводительных кластеров.
Требования:
- Понимаете архитектуру высокопроизводительных кластеров и принципы их построения;
- Знаете, что такое Infiniband и как строятся сети для HPC/AI/ML-кластеров;
- Имеете большой опыт работы с планировщиками распределенных вычислений (например Slurm);
- Имеете опыт работы с распределенными файловыми системами;
- Понимаете, как оптимизировать Linux для получения максимальной производительности ML кластера и IB сети;
- Умеете писать скрипты для автоматизации собственных задач
