1 / 9Для тех, кто следит за развитием архитектур глубокого обучения и практическими решениями проблемы затухающего градиента.
Автор представляет LTanh — гибридную функцию активации для глубоких нейронных сетей, которая сохраняет форму классического Tanh, но при этом решает проблему затухающего градиента. Это одна из базовых проблем обучения глубоких моделей, и любое решение в этой области вызывает интерес у практиков.
В статье описывается, как автор пришёл к формуле, приводится вывод производной и сравнение LTanh с Tanh в диапазоне значений от 0 до 5. Ключевое заявленное преимущество — существенно более выразительное поведение в хвостах: от 150 до 850 000 раз, что потенциально улучшает обучение на глубоких архитектурах.
Материал ориентирован на специалистов по машинному обучению и исследователей, работающих с архитектурами сетей. Для медиаиндустрии такие разработки важны косвенно — через инструменты генерации, рекомендательные системы и обработку контента.
Полные формулы, графики и экспериментальные данные — на Хабре.
Материал агрегирован; полный текст — на сайте Хабр — ИТ-новости.
Увеличить1 / 9