T27.AI

Блог

Тридцать эпох выявили слепую зону доли отказов

2026-08-20 · 6 мин чтения

Тридцатиэпоховый sweep на MNIST показал, почему рядом с порогом по доле отказов нужны значения по каждому seed: счёт «прошёл» может сосуществовать с неперекрывающимися прогонами.

Гравюрный триптих к статье: Тридцать эпох выявили слепую зону доли отказов
Три панели, слева направо

Подписи на изображении — на английском.

  1. THE COUNTA passing count says how many crossed.
  2. THE SPREADThe runs did not overlap at all.
  3. THE BLIND SPOTA rate hides the shape of the data.
Открыть полный триптих в исходном размере
#FPGA#MNIST#Measurement#Reproducibility#SelfCritique

[измерено — обучающий sweep на MNIST] Тридцатиэпоховый прогон проверял, остаётся ли сводка по доле отказов информативной по мере продолжения обучения. Не остаётся: значения по отдельным seed показали разрыв, который сама доля скрывает.

На 30 эпохах срез по пяти seed дал для TNF4 0/5 отказов и среднюю точность 97,82 ± 0,15. В том же срезе fp6 e2m3 дал 4/5 отказов, а fp6 e3m2 — 2/5 отказов. Это измерения эксперимента на MNIST, а не заявление об общем рейтинге форматов.

Порог может быть пройден, даже если прогоны не согласуются

При пороге 60% fp6 e3m2 проходит 3/5 прогонов. Но максимальный его прогон достигает 71,9, тогда как худший прогон TNF4 достигает 97,6: распределения не перекрываются, разрыв составляет 25,7 пункта. Доля считает пересечения линии, но не описывает распределение, равномерно лежащее ниже.

ФорматОтказы на 30 эпохахТочность по seed
TNF40/598,0; 97,6; 97,8; 97,9; 97,8
fp6 e2m34/519,2; 81,0; 9,6; 12,7; 11,3
fp6 e3m22/571,9; 65,6; 55,5; 71,4; 59,3

Долгое обучение не добавило ожидаемого дрейфа

Для TNF4 опубликованное среднее изменилось с 96,76 на 3 эпохах до 97,68 на 10 эпохах и 97,82 ± 0,15 на 30 эпохах. По восьми конфигурациям суммарная доля отказов составила TNF4 0/40, fp6 e2m3 29/40 и fp6 e3m2 24/40.

Список значений по seed — формат представления, который не скрывает, какие прогоны сдвинулись.

Что это НЕ доказывает

Полезный результат методический: сохранять долю отказов для её узкого вопроса, но печатать рядом каждое значение seed. Небольшое добавление превращает счёт «прошёл» в проверяемую картину отдельных прогонов.

Чего это не решает

Пруфы

Поработаем вместе

Хотите так же проверить собственный дизайн?

Я аудирую RTL и строю независимые побитово точные модели, затем провожу результат через синтез и, когда это полезно, проверяю на плате Artix-7. Первый модуль проверки — бесплатно.