Яндекс

Разработчик инфраструктуры LLM

Санкт-Петербургoffice

О компании

Яндекс — один из крупнейших IT-компаний России, занимающийся разработкой технологий и решений в области интернет-сервисов. Компания активно работает над проектами в области искусственного интеллекта, включая разработку больших языковых моделей (LLM) и оптимизацию их инфраструктуры. Яндекс осуществляет полный цикл разработки и внедрения своих технологии, обеспечивая высокую доступность и качество предоставляемых услуг.

Ключевые факты:

  • Один из ведущих игроков на рынке интернет-технологий в России
  • Широкий спектр продуктов, включая поисковые системы, картографические сервисы и сервисы для бизнеса
  • Высокие стандарты безопасности и производительности своих технологий
  • Команда специалистов, работающих над современными проектами в области AI и ML

О вакансии

Команда, занимающаяся LLM в Яндексе, решает сложные задачи, связанные с производительностью и доступностью сервисов инференса. Основное внимание уделяется разработке и оптимизации инфраструктуры, чтобы гарантировать эффективность работы больших языковых моделей. Основные задачи включают минимизацию задержек и создание надежных систем, способных обрабатывать большие объемы данных.

Ваша роль будет заключаться в оптимизации инференсных движков и упрощении процесса их диагностики. Вы будете развивать инструменты, позволяющие быстро выявлять и устранять проблемы, тем самым повышая стабильность и скорость инференса. Кроме того, вам предстоит исследовать новые методы, такие как квантование и прунинг, а также внедрять современные подходы к параллелизации.

Чем предстоит заниматься:

  • Оптимизация движков для LLM-инференса на GPU с целью повышения их эффективности и снижения latency
  • Разработка инструментов диагностики для выявления инфраструктурных проблем
  • Исследование методов оптимизации инференса и внедрение лучших практик

Что мы предлагаем:

  • Доступ к современным технологиям и возможность работы с передовыми решениями в области AI
  • Участие в крупных проектах, связанных с оптимизацией и внедрением LLM

Обязанности

  • Оптимизация движков для LLM-инференса на GPU
  • Снижение latency при выполнении инференса
  • Создание и улучшение инструментов диагностики
  • Работа с методами оптимизации инференса, такими как квантование и прунинг
  • Внедрение современных подходов к параллелизации

Похожие вакансии

Как получить эту работу — с ИИ-помощником РаботаМакс

Бесплатно поможем на каждом шаге. Нажмите, чтобы раскрыть.