T27.AI

Блог

Тридцать эпох выявили слепую зону доли отказов

2026-08-20 · 6 мин чтения

Тридцатиэпоховый sweep на MNIST показал, почему рядом с порогом по доле отказов нужны значения по каждому seed: счёт «прошёл» может сосуществовать с неперекрывающимися прогонами.

FPGAMNISTMeasurementReproducibilitySelf-critique

[измерено — обучающий sweep на MNIST] Тридцатиэпоховый прогон проверял, остаётся ли сводка по доле отказов информативной по мере продолжения обучения. Не остаётся: значения по отдельным seed показали разрыв, который сама доля скрывает.

На 30 эпохах срез по пяти seed дал для TNF4 0/5 отказов и среднюю точность 97,82 ± 0,15. В том же срезе fp6 e2m3 дал 4/5 отказов, а fp6 e3m2 — 2/5 отказов. Это измерения эксперимента на MNIST, а не заявление об общем рейтинге форматов.

Порог может быть пройден, даже если прогоны не согласуются

При пороге 60% fp6 e3m2 проходит 3/5 прогонов. Но максимальный его прогон достигает 71,9, тогда как худший прогон TNF4 достигает 97,6: распределения не перекрываются, разрыв составляет 25,7 пункта. Доля считает пересечения линии, но не описывает распределение, равномерно лежащее ниже.

ФорматОтказы на 30 эпохахТочность по seed
TNF40/598,0; 97,6; 97,8; 97,9; 97,8
fp6 e2m34/519,2; 81,0; 9,6; 12,7; 11,3
fp6 e3m22/571,9; 65,6; 55,5; 71,4; 59,3

Долгое обучение не добавило ожидаемого дрейфа

Для TNF4 опубликованное среднее изменилось с 96,76 на 3 эпохах до 97,68 на 10 эпохах и 97,82 ± 0,15 на 30 эпохах. По восьми конфигурациям суммарная доля отказов составила TNF4 0/40, fp6 e2m3 29/40 и fp6 e3m2 24/40.

Список значений по seed — формат представления, который не скрывает, какие прогоны сдвинулись.

Что это НЕ доказывает

Полезный результат методический: сохранять долю отказов для её узкого вопроса, но печатать рядом каждое значение seed. Небольшое добавление превращает счёт «прошёл» в проверяемую картину отдельных прогонов.

Чего это не решает

Пруфы

Каждая цифра выше измерена, и рядом с ней названы её пределы.