Macro Micro News Global Pulse. Local Truth.

Стабильное глубокое обучение: как инициализация RReLU решает проблему затухающих градиентов

21 September 2026 · 1 min read

We compile, generate and translate using Artificial Intelligence from the below given source. Macro Micro News is responsible for its editorial publication.

Article image by Pietro Jeng
Image by Pietro Jeng

Базель, Швейцария.

Глубокое обучение совершило революцию в искусственном интеллекте. Тем не менее обучение глубоких нейронных сетей остается сложной задачей. Исследователи сталкиваются с такими проблемами, как затухание градиентов и нестабильность оптимизации. Недавнее исследование, опубликованное в журнале Electronics (MDPI), предлагает новую схему инициализации весов. Она специально разработана для случайных утекающих линейных блоков (RReLU). Это решение значительно улучшает обучаемость моделей и стабильность сходимости.

Стандартные функции активации, такие как ReLU, вычислительно эффективны. Однако они часто страдают от проблемы «умирающего ReLU». В этом случае нейроны навсегда перестают быть активными. Альтернативы вроде LReLU и PReLU пытаются смягчить эту проблему. Но RReLU выделяется наличием стохастичности. Этот метод случайно выбирает отрицательный наклон во время обучения. Такая стратегия действует как регуляризатор. Предыдущие методы инициализации, включая подходы Xavier и He, не учитывали распределение случайных наклонов. Из-за этого в глубоких архитектурах достигались субоптимальные результаты.

Исследователи вывели новую формулу инициализации, сохраняющую дисперсию. Она явно учитывает статистические свойства стохастического наклона RReLU. Авторы проанализировали распространение сигнала при прямом ходе и поток градиентов при обратном. Предложенный метод гарантирует стабильность дисперсии сигналов через все слои сети. Теоретические выводы были тщательно проверены на полносвязных нейронных сетях и глубоких сверточных нейронных сетях (CNN). Для тестирования использовались бенчмарки CIFAR-10, CIFAR-100 и ImageNet.

Эксперименты показали, что специализированная инициализация для RReLU превосходит традиционные методы Xavier и He. Особенно заметен выигрыш в очень глубоких сетях. Например, в 200-слойных полносвязных сетях и 30-слойных CNN новая схема обеспечивала стабильную оптимизацию. Метод Xavier часто не мог достичь сходимости. Сравнение различных функций активации также выявило важные детали. PReLU показала наибольшую точность на крупных наборах данных, таких как ImageNet. LReLU и RReLU продемонстрировали конкурентоспособную обобщающую способность на меньших наборах, таких как CIFAR. Это особенно верно при использовании соответствующих оптимизированных стратегий инициализации.

Это исследование подчеркивает важность согласования инициализации весов со статистическими характеристиками функций активации. Новая схема замыкает разрыв между теорией и практикой. Она создает надежную основу для обучения более глубоких и сложных сетей. Разработчики смогут избегать ловушек оптимизации. По мере роста размера и сложности моделей ИИ такие точные техники инициализации станут необходимыми. Они откроют путь к более высокой производительности и надежности в задачах классификации изображений и других областях.