Блог
Смерженная исследовательская правка заменяет 140 объединённых окон четырьмя репликами уровня модели и превращает одиннадцать видимых вердиктов в ничьи.
PR #563 смержен в gHashTag/trinity-fpga. Он исправляет статистическую ошибку в кампании B: четыре модели дали по 35 окон, а скрипт объединял их в n = 140 перед парным тестом. Эти окна повторяют текст внутри модели; они не создают 140 независимых чекпоинтов моделей. Для утверждения о семействе моделей единица репликации — модель, поэтому n = 4.
d = np.concatenate([dvec(D, m, arm, ref) for m in models])
r = paired(d)
Правка меняет единицу анализа, а не кодбуки и не сохранённые значения NLL. Теперь вспомогательная функция сначала усредняет вклад каждой модели, если моделей несколько, а окна сохраняет только для утверждений, которые явно делаются внутри одной модели.
| Сравнение | Объединение окон, n = 140 | Уровень модели, n = 4 | Исправленное чтение |
|---|---|---|---|
| MX-asym-MID против MXFP4 | −2.21 %, p = 9.6e-26 | −2.08 %, p = 0.019 | ничья |
| MX-asym-NEAR0 против MXFP4 | −4.99 %, p = 1.6e-44 | −4.76 %, p = 0.032 | ничья |
| MX-asym-NEAR0 против NF4 | −0.92 %, p = 1.6e-02 | −0.92 %, p = 0.655 | ничья |
| JK-asym-MID против JOINT-KL | −2.32 %, p = 1.9e-22 | −2.18 %, p = 0.078 | ничья |
Точечные оценки почти не сдвигаются: −4.99 % превращается в −4.76 %, а −2.21 % — в −2.08 %. Сдвигается неопределённость. Интервалы растут примерно на корень из 35, когда окна перестают считаться независимыми репликами модели. Одиннадцать из четырнадцати вердиктов превращаются в ничьи; один сохраняется.
Сохранилась строка JK-asym-NEAR0 против JOINT-KL: −2.42 % с интервалом [−3.56 %, −1.26 %] и p = 0.007 на уровне модели. Собственная метка строки говорит 3/4 in-sample, поэтому это не утверждение о невиданном чекпоинте. Отдельно остаётся внутри-модельное наблюдение: MX-asym-NEAR0 обходит MXFP4 в 140 из 140 окон на четырёх моделях. Это утверждение об измеренных текстах, а не новая гарантия для всего семейства.
Единица репликации — часть утверждения. Её нужно писать там, где формулируется утверждение, а не протаскивать незаметно операцией над массивом.
Четыре строки сдвинулись в сторону кодбуков, семь — в обратную. Исправление не просто стирает результаты, благоприятные одной стороне. Оно убирает ложную точность в обоих направлениях и оставляет более узкий, читаемый результат: сохранённые измерения поддерживают несколько наблюдений внутри моделей, но более широкие вердикты по чекпоинтам были завышены.
Каждая цифра выше измерена, и рядом с ней названы её пределы.