Пожаловаться на объявление
ML Engineer (Middle+/Senior) - Москва
вторник, 6 октября 2026 г.
Параметры объявления
Город:
Москва
Тип предложения:
Предложение
Должность:ML Engineer (Middle+/Senior)
Тип занятости:Полная
График работы:Полный день
Опыт работы:от 1 до 3 лет
Зарплата:
от 220 000 до 260 000 руб.
Текст объявления
Middle AI / LLM Engineer
Ищем прикладного AI-инженера для запуска и адаптации open-source моделей под наши продукты.
Наш фокус — не теоретический R&D, а быстрая доставка готовых ML-решений в продакшен: взять проверенную открытую модель, дообучить под наши сценарии и задеплоить на собственном GPU-сервере.
Продуктовый бэкенд, базы данных и сбор данных закрывает основная команда разработки. Ваша зона ответственности — подбор и тюнинг моделей, инференс, производительность на GPU и качество генерации.
Чем предстоит заниматься:
— Сервинг и инференс: развернуть и сопровождать open-source модели (Qwen, Llama и др.) на выделенном сервере с GPU Nvidia через vLLM.
— Стилизация и адаптация (LoRA): дообучать модели под определенную персону (сленг, подача, характерные мысли) через LoRA / QLoRA с сохранением связности и логики ответов.
— Семантический поиск и классификация (RAG): собирать пайплайны контекстного поиска на базе эмбеддеров для русского языка (ruBERT / BGE / Sentence Transformers).
— AI-агенты: настраивать логику вызова инструментов и промпт-пайплайны под автономные задачи.
— Генерация изображений: поднять и настроить готовый сервис генерации картинок на базе open-source моделей (Flux / SDXL).
Что для этого нужно:
— Коммерческий опыт в прикладном ML / NLP от 2 лет.
— Опыт запуска и инференса LLM на видеокартах Nvidia (понимание vLLM, Docker, работы с CUDA и контролем видеопамяти без падений в OOM).
— Практический опыт файн-тюнинга через LoRA / QLoRA (Hugging Face PEFT, TRL, Unsloth).
— Понимание подготовки данных: фильтрация шума, сбор пар «промпт-ответ», предотвращение выгорания логики модели (catastrophic forgetting).
— Базовый опыт (или четкое понимание), как поднять готовый инференс для генерации картинок (Diffusers, ComfyUI API).
Будет плюсом:
— Уверенный прикладной Python: умение написать чистый скрипт предобработки данных, обернуть инференс в простую ручку на FastAPI или автоматизировать пайплайн без спагетти-кода.
— Опыт работы с легковесными NLP-моделями (ruBERT-tiny2) под задачи классификации текстов.
Условия:
— Формат: первые 1–2 месяца — офис в Москве, далее — удобный гибрид по запросу.
— Инфраструктура: выделенный сервер с мощными GPU Nvidia под задачи без очередей и квот.
— Команда и процессы: быстрый цикл принятия решений, понятные прикладные задачи и готовая бэкенд-команда на поддержке.
Дополнительные преимущества:
Обучение, тренинги
Ищем прикладного AI-инженера для запуска и адаптации open-source моделей под наши продукты.
Наш фокус — не теоретический R&D, а быстрая доставка готовых ML-решений в продакшен: взять проверенную открытую модель, дообучить под наши сценарии и задеплоить на собственном GPU-сервере.
Продуктовый бэкенд, базы данных и сбор данных закрывает основная команда разработки. Ваша зона ответственности — подбор и тюнинг моделей, инференс, производительность на GPU и качество генерации.
Чем предстоит заниматься:
— Сервинг и инференс: развернуть и сопровождать open-source модели (Qwen, Llama и др.) на выделенном сервере с GPU Nvidia через vLLM.
— Стилизация и адаптация (LoRA): дообучать модели под определенную персону (сленг, подача, характерные мысли) через LoRA / QLoRA с сохранением связности и логики ответов.
— Семантический поиск и классификация (RAG): собирать пайплайны контекстного поиска на базе эмбеддеров для русского языка (ruBERT / BGE / Sentence Transformers).
— AI-агенты: настраивать логику вызова инструментов и промпт-пайплайны под автономные задачи.
— Генерация изображений: поднять и настроить готовый сервис генерации картинок на базе open-source моделей (Flux / SDXL).
Что для этого нужно:
— Коммерческий опыт в прикладном ML / NLP от 2 лет.
— Опыт запуска и инференса LLM на видеокартах Nvidia (понимание vLLM, Docker, работы с CUDA и контролем видеопамяти без падений в OOM).
— Практический опыт файн-тюнинга через LoRA / QLoRA (Hugging Face PEFT, TRL, Unsloth).
— Понимание подготовки данных: фильтрация шума, сбор пар «промпт-ответ», предотвращение выгорания логики модели (catastrophic forgetting).
— Базовый опыт (или четкое понимание), как поднять готовый инференс для генерации картинок (Diffusers, ComfyUI API).
Будет плюсом:
— Уверенный прикладной Python: умение написать чистый скрипт предобработки данных, обернуть инференс в простую ручку на FastAPI или автоматизировать пайплайн без спагетти-кода.
— Опыт работы с легковесными NLP-моделями (ruBERT-tiny2) под задачи классификации текстов.
Условия:
— Формат: первые 1–2 месяца — офис в Москве, далее — удобный гибрид по запросу.
— Инфраструктура: выделенный сервер с мощными GPU Nvidia под задачи без очередей и квот.
— Команда и процессы: быстрый цикл принятия решений, понятные прикладные задачи и готовая бэкенд-команда на поддержке.
Дополнительные преимущества:
Обучение, тренинги
