Издание об искусственном интеллекте
Написать
КЛН
Ким Ли
ИИ

Почему бенчмарки на длинный контекст почти всегда врут

Разбор восьми популярных наборов и того, как в них просачивается утечка из обучающей выборки.

Ниже — подробности: что именно произошло, почему это заметили и что из этого следует для тех, кто работает с этим каждый день.

Что случилось

Разбираем по порядку, со ссылками на первоисточники в конце материала. Там, где данные противоречивы, мы говорим об этом прямо.

  • Первое наблюдение, которое проверяется по открытым данным.
  • Второе — то, что подтверждают участники рынка.
  • Третье — то, что пока остаётся версией и требует проверки.
Мы не утверждаем, что так будет всегда. Мы говорим, что сейчас данные выглядят именно так.Из комментария участника рынка

Что с этим делать

Если задача близка к описанной — стоит проверить на своих данных, прежде чем принимать решение. Универсального ответа здесь нет.

+
6
44K
Войдите, чтобы комментировать
6 комментариев
Забираю формулировку, очень точно сказано.
+
КЛ
20 авг автор
Так в статье про это и написано, второй абзац.
+
Спасибо за разбор, наконец-то без пресс-релизного тона.
+
Вот с последним тезисом не соглашусь, слишком широкое обобщение.
+
Один бенчмарк — это не результат, а гипотеза. Подождём независимую проверку.
+
Так в статье про это и написано, второй абзац.
+

Рекомендации

КЛН
Ким Ли
ИИ

Разбор препринта: как маленькая сеть-отборщик решает, что модели вообще стоит читать

Четыре страницы математики, которые сводятся к одной простой мысли — большую часть контекста можно выкинуть, и этому можно научиться.

Показать полностью
+
7
27K