Ускорение нейросетей

Научитесь решать задачи эффективно

Поймёте теорию, узнаете про основные сложности и отточите знания на практике

Доступ сразу после оплаты

Почему DL-инженерам важно разбираться в ускорении нейросетей

Курс для тех, кто уже работает в индустрии и хочет

Разобраться в теории

Чтобы понимать, как работает каждый метод ускорения сетей

Освоить фреймворки

И оптимальным образом ускорять модели под каждый вычислитель

Поднять скиллы

Освоить востребованный навык, чтобы поднять свою ценность

Перенять опыт

Узнать про все сложности от экспертов области

Чему вы научитесь

Ускорять инференс за счёт изменения архитектуры и утилизации вычислителя

Ускорять инференс нейросетей

Узнаете, как устроен каждый алгоритм: дистилляция, прунинг, квантизация, матричные разложения и NAS

Совмещать все методы воедино

Сможете комбинировать различные подходы и решать вытекающие трудности

Запускать инференс на различных устройствах

Разберетесь в устройстве CPU, GPU, NPU и научитесь запускать сети на смартфонах и микрокомпьютерах

Сохранять точность при ускорении

Создавать модели с высокой точностью и высоким fps даже на одноплатных компьютерах

Программа

Лекции в записи. После каждой темы — домашнее задание с авторскими решениями и дополнительными материалами.

  1. Блок 1. Основы – 5 лекций Научитесь ускорять инференс за счёт изменения архитектуры сети. Проведёте нейросеть через прунинг, квантизацию и дистилляцию.

    1. Дистилляция

    Метод для улучшения точности нейронной сети. При комбинации с другими методами — для ее ускорения

    Темы лекции:

    • Дистилляция и DarkKnowledge
    • Функции потерь для дистилляции: MSE / KLD / MAE
    • Дистилляция для ускорения моделей
    • Дистилляция в классических CV-задачах: classification, detection, identification

    На практике: Научитесь дистиллировать сеть для сегментации людей

    2. Прунинг

    Метод для сокращения вычислительных операций за счет выброса лишних нейронов

    Темы лекции:

    • Критерии прунинга: L1 / L2 / taylor
    • Структурированный и неструктурированный прунинг
    • Фундаментальные свойства нейронной сети и lottery ticket hypothesis

    На практике: Научитесь прунить нейронную сеть с фреймворком для структурированного прунинга torch-pruning

    3. Low-Precision computing

    Квантование нужно для представления нейронной сети через тип данных, меньший исходного. С его помощью она сможет использоваться на устройстве с малыми вычислительными ресурсами

    Темы лекции:

    • 8-ми битное квантование
    • Quantization aware training как способ улучшения качества нейронной сети
    • Нестандартные типы данных: fp16 / fp8 / bfloat16
    • Post-Train quantization как способ заквантовать сетку без головной боли
    • Cовременные методы квантования: HAWQ и HAWQ-v2

    На практике: Научитесь пользоваться фреймворком квантования torch.quantization/qnnpack

    4. NAS

    Метод для оптимального подбора архитектуры сети под конкретные задачи

    Темы лекции:

    • Дифференцируемый и недифференцируемый NAS
    • DARTs как основа всех методов для дифф прунинга
    • Суперсети и подархитектуры, их связь с прунингом
    • Способы обучения суперсетей
    • Zero-shot NAS

    5. Эффективные архитектуры

    Эффективные архитектуры нейронных сетей для решения самых разных задач

    Темы лекции:

    • Общие эффективные ахитектуры: MobileOne, FastVit
    • Эффективные архитектуры для детекции, или жизнь без Yolo
    • Сегментация PIDNet и DDR-Net
    • Эффективный speech2text
  2. Блок 2. LLM – 2 лекции Познакомитесь с методами ускорения, специфичными для больших языковых моделей

    1. Основы ускорения LLM

    Основные рабочие лошадки для ускорения LLM'ок

    Темы лекции:

    • MemoryBound вычисления, или как сделать attention быстрее
    • Особенности квантования LLM
    • Современные методы и механизмы квантования: QuIP, QuIP#, AQLM
    • Sparse-перемножение матриц и принцип работы SparseGPT

    На практике: Изучите и сравните современные библиотеки для локального инфренса LLM

    2. Специфичные методы ускорения LLM

    Дополнительные механизмы ускорения с обзором небольших и крупных языковых моделей

    Темы лекции:

    • Conditional Inference
    • Speculative decoding
    • Small Large Language Models
    • Современные opensource-фреймворки для ускорения: vLLM, TensorRT-LLM, GGML

    На практике: Ускорите LLM с помощью этих методов

  3. Блок 3. Девайсы – 6 лекций Познакомитесь с ускорением сетей на x86, CPU и GPU. Научитесь запускать нейронные сети на Android, iOS и микрокомпьютерах

    CPU: ARM + Android

    Создание простого приложения на мобильном устройстве с использованием нейросетей и её запуск на конкретном девайсе

    Темы лекции:

    • Особенности ОС Android
    • Что такое делегаты и какими они бывают
    • NN-API как основной делегат для запуска
    • Квантование TFLite
    • Использование фреймворка MNN

    На практике: Сравните ускорения разных нейронных сетей на мобильном телефоне

    CPU: ARM + iOS

    То же самое, но на iPhone с его фреймворками для запуска

    Темы лекции:

    • Устройство iOS
    • Фреймворк CoreML
    • Низкоуровневые фреймворки: Metal, BNNS, Accelerate
    • Квантование в iOS

    На практике: Создадите свое приложение с ускоренной нейронной сетью

    Микроконтроллеры

    Одноплатники и их особенности для нейросетей

    Темы лекции:

    • Устройство и ключевые особенности
    • Производители микрокомпьютеров
    • Проблемные слои
    • Общий workflow

    На практике: Запустите нейронную сеть на RKNN-фреймворке для rock chip

    Инференс на процессоре

    Инференс на процессоре для ускорения нейронной сети

    Темы лекции:

    • Базовое устройство процессора
    • x86 vs ARM: особенности инференса

    На практике: Научитесь пользоваться фреймворком для квантования OpenVINO

    Инференс на графическом ускорителе. Part 1

    Инференс на графическом ускорителе нейронной сети

    Темы лекции:

    • Особенности работы GPU
    • Принцип работы TensorRT
    • Понятие CudaGraph

    На практике: Научитесь применять квантование на TRT

    Инференс на графическом ускорителе. Part 2

    Инференс на графическом ускорителе нейронной сети

    Темы лекции:

    • Cuda Event: как работают профилировщики на его основе
    • Cuda Event: как померить latency отдельных операций на конкретном примере
    • Профайлинг в торче
    • TensorRT: как посмотреть оптимизированный граф
    • TensorRT [advanced]: как запретить оптимизировать отдельные операции

    На практике: Научитесь применять квантование на TRT

Записаться

Как именно вы освоите каждый навык

1.

Изучите теорию на лекции

Лекции в записи на платформе — можно смотреть в удобное время, ставить на паузу и пересматривать

1/2
2.

Сделаете практическое задание

После каждой лекции — домашнее задание с авторским решением

2/2

Кто будет преподавать

Опытные инженеры. Каждый расскажет про задачу, с которой несколько лет работал в коммерческих проектах

Александр Гончаренко

Александр Гончаренко

enot.ai

CTO в стартапе, занимается созданием R&D версий алгоритмов и проверкой первичных гипотез, которые потом допиливаются и идут во фреймворк

Артур Панюков

Артур Панюков

Intel

Добавляет в NLP фичи в инференс-фреймворк OpenVINO. Расскажет про особенности его работы и запуска сетей на CPU

Илья Ревин

Илья Ревин

ИТМО

Научит оптимизировать архитектуры нейросетей с помощью тензорной факторизации и аппроксимации

Дмитрий Чудаков

Дмитрий Чудаков

2GIS

Делает PhD по квантованию. Расскажет про Low-Precision computing

Дмитрий Гордин

Дмитрий Гордин

TapMobile

Работал над видео-режимом в Android приложении Яндекс. Расскажет про работу с Android камерой, подключение OpenCV, инференс нейросетей

Илья Начевский

Илья Начевский

SkyEng

Занимается разработкой мультимодальных LLM агентов. Расскажет про ускорение LLM

Андрей Щербин

Андрей Щербин

enot.ai

Имеет большой опыт в применении алгоритмов оптимизации к конкретным моделям. Расскажет про алгоритмы прунинга

Тимофей Науменко

Тимофей Науменко

wanna.fashion

Занимается примеркой часов и кроссовок в виртуальной реальности. До этого занимался алгоритмами автоматического поиска архитектур нейронных сетей

Александр Ковальчук

Александр Ковальчук

Prequel

Запускал генеративные модели на камере iOS устройства. Расскажет о конвертации нейросетей для мобильных устройств с iOS и их запуске через CoreML и TFLite

Игорь Калгин

Игорь Калгин

enot.ai

Главный разработчик фреймворка ЕНОТ, программный архитектор. Поделится практическим опытом работы с TensorRT

Пётр Иванов

Пётр Иванов

enot.ai

Занимается разработкой приложений на EDGE устройствах. Расскажет про эффективные архитектуры нейронных сетей

После обучения

Чат выпускников

Вы попадаете в чат выпускников — чат с опытными инженерами, где мы проводим литклубы, random coffee и обсуждаем вопросы с работы

Сертификат о прохождении обучения

Доступ к материалам курса на один год

Комфортные условия для вашей учёбы

Полный возврат стоимости в первые 14 дней,
если поймёте, что программа вам не подходит. Если примете решение позже, вернём деньги за вычетом уже пройденных занятий

Налоговый вычет
получите 13% от стоимости курса после обучения

Оплата из-за рубежа
картой иностранного банка или другими удобными способами

Может оплатить компания. мы принимаем оплату от юрлиц, если хотите, чтобы работодатель оплатил ваше обучение, пусть ваши представители напишут нам на b2b@deepschool.ru для оформления документов и оплаты

Мы обучаем по лицензии Л035-01199-54/00734237 ↗

Тарифы

Каждый тариф включает в себя:

  • Записи лекций
  • Домашние задания
  • Авторские решения
  • Доступ сразу
  • Дополнительные материалы

Основы + Девайсы + LLM

Что входит в курс:

13 лекций

  • - Дистилляция
  • - Прунинг
  • - Low-Precision computing
  • - NAS
  • - Эффективные архитектуры
  • - Основы ускорения LLM
  • - Специфичные методы ускорения LLM
  • - Инференс на процессоре
  • - Инференс на GPU, ч.1
  • - Инференс на GPU, ч.2
  • - CPU: ARM + Android
  • - CPU: ARM + iOS
  • - Микроконтроллеры

Основы ускорения

Что входит в курс:

5 лекций

  • - Дистилляция
  • - Прунинг
  • - Low-Precision computing
  • - NAS
  • - Эффективные архитектуры
  • - Основы ускорения LLM
  • - Специфичные методы ускорения LLM
  • - Инференс на процессоре
  • - Инференс на GPU, ч.1
  • - Инференс на GPU, ч.2
  • - CPU: ARM + Android
  • - CPU: ARM + iOS
  • - Микроконтроллеры

Девайсы

Что входит в курс:

6 лекций

  • - Дистилляция
  • - Прунинг
  • - Low-Precision computing
  • - NAS
  • - Эффективные архитектуры
  • - Основы ускорения LLM
  • - Специфичные методы ускорения LLM
  • - Инференс на процессоре
  • - Инференс на GPU, ч.1
  • - Инференс на GPU, ч.2
  • - CPU: ARM + Android
  • - CPU: ARM + iOS
  • - Микроконтроллеры

Ускорение LLM

Что входит в курс:

2 лекции

  • - Дистилляция
  • - Прунинг
  • - Low-Precision computing
  • - NAS
  • - Эффективные архитектуры
  • - Основы ускорения LLM
  • - Специфичные методы ускорения LLM
  • - Инференс на процессоре
  • - Инференс на GPU, ч.1
  • - Инференс на GPU, ч.2
  • - CPU: ARM + Android
  • - CPU: ARM + iOS
  • - Микроконтроллеры

Что говорят наши выпускники

Истории глазами тех, кто успешно прошёл обучение

Елизавета Носова

Елизавета Носова

(Ускорение)

LinkedIn
«Каждая лекция покрывает объёмный материал и включает практические рекомендации, которые можно применить»
Читать отзыв полностью ↗
Иван Петров

Иван Петров

(Ускорение)

LinkedIn
«Курс понравился: первая часть сильно ориентирована на прикладные DS задачи, мне показалась очень полезной»
Читать отзыв полностью ↗
Виктор Юдин

Виктор Юдин

(Ускорение)

LinkedIn
«Курс крутой, много полезного узнал. Очень удобно, что по ускорению собрали все вместе, много тем охватили!»
Читать отзыв полностью ↗
Артём Соломко

Артём Соломко

(Ускорение)

LinkedIn
«Я был удивлен уровнем сложности и глубины информации, которую я получил на лекциях. Это второй мой курс от этой команды»
Читать отзыв полностью ↗
Арсений Рылов

Арсений Рылов

(CV Rocket)

LinkedIn
«Курс оказался крайне полезным. Благодаря лекторам, тьюторам и создателям программы, я смог углубить свои знания»
Читать отзыв полностью ↗
Мария Старцева

Мария Старцева

(CV Rocket)

LinkedIn
«Воспользовалась на работе некоторыми идеями и мне очень пригодился код для построения рабочих пайплайнов»
Читать отзыв полностью ↗
Ольга Чаганова

Ольга Чаганова

(CV Rocket)

LinkedIn
«После обучения стала ощущать себя намного увереннее, многие вещи стали понятнее, осталось только углублять знания»
Читать отзыв полностью ↗
Александр

Александр

(CV Rocket)

LinkedIn
«На собеседовании за счет того, что подчерпнул на курсе об устройстве OCR, вытянул»
Читать отзыв полностью ↗

FAQs

Если у вас остались вопросы по курсу, напишите нам в Telegram

Написать в Telegram

Наши программы

Поможем освоить востребованные на рынке знания, передав секреты и опыт практикующих инженеров и исследователей

Телеграм-канал DeepSchool

Короткие посты по теории ML/DL, полезные библиотеки и фреймворки, вопросы с собеседований и советы, которые помогут в работе

Открыть Телеграм