T27.AI

Блог

Поправка на множественные сравнения изменила чтение развёртывания

2026-08-17 · 6 мин чтения

Смерженная исследовательская заметка показывает, как выбор из девяти placements по среднему отступу становится более узким утверждением после учёта семейства сравнения.

Гравюрный триптих к статье: Поправка на множественные сравнения изменила чтение развёртывания
Три панели, слева направо

Подписи на изображении — на английском.

  1. THE SELECTIONNine placements, chosen by margin.
  2. THE FAMILYThe selection family counts too.
  3. THE LIMITThe claim came out narrower.
Открыть полный триптих в исходном размере
#Measurement#Reproducibility#Statistics#Quantization

Смерженная исследовательская заметка меняет чтение одного выбора кодбука. В кампании развёрнутый вариант выбирали по среднему отступу, а затем применили поправку на множественные сравнения к девяти placements, из которых делался выбор.

На уровне модели сравнение имеет n = 5 контрольных точек. Развёрнутый NEAR0 имеет средний отступ −4,03 %, 95%-й интервал [−7,32; −0,63], p = 0,031 до поправки ×9 и 0,279 после неё. В скорректированной таблице его статус — TIE.

Таблица после поправки

PlacementСреднее95%-й интервалp ×9Вердикт
NEAR0 (развёрнут)−4,03 %[−7,32; −0,63]0,279TIE
MID−2,12 %[−3,07; −1,16]0,036BEATS

MID получает статус BEATS в таблице девяти placements: скорректированное p равно 0,036. Это более узкое утверждение, чем рекомендация к развёртыванию. В парном сравнении с NEAR0 разница MID составляет +1,99 %, интервал [−1,17; +5,25], p = 0,157, поэтому при n = 5 это ничья.

Почему среднее оказалось нестабильным

NEAR0 меняется от −1,06 до −8,07 % на пяти контрольных точках: разброс 7,01 процентного пункта. MID меняется от −1,21 до −3,09 %, разброс 1,88 процентного пункта. Если убрать контрольную точку Pythia, NEAR0 меняется до −2,98 %, а MID остаётся на −2,01 %.

При leave-one-checkpoint-out выборе по среднему отступу NEAR0 выбирается 5 раз из 5. Методологический вывод заметки: выбор по сырому среднему и отчёт после поправки на множественные сравнения могут вознаграждать вариант с большим разбросом, потому что статистика выбора и итоговое утверждение отвечают на разные вопросы.

Исходные данные тоже были частью результата

В том же смерженном изменении зафиксировано, что каталог весов находился в /tmp другого сеанса и исчез в середине кампании. Корпус и модель восстановили, затем повторили контрольную линейку и только после совпадения с эталонными значениями сочли измерения до и после потери сопоставимыми. Это квитанция воспроизводимости, а не заявление о производительности.

Чего это не доказывает

Скорректированный ярлык — не решение о развёртывании. Это более узкое утверждение с явно названным семейством выбора.

Практический урок для инженера: до измерения зафиксировать семейство выбора и статистику, а не превращать измеренный отступ в общий результат. Квитанция — смерженный PR и его исследовательские заметки.

Чего это не решает

Пруфы

Поработаем вместе

Хотите так же проверить собственный дизайн?

Я аудирую RTL и строю независимые побитово точные модели, затем провожу результат через синтез и, когда это полезно, проверяю на плате Artix-7. Первый модуль проверки — бесплатно.