Модель на 3 млрд параметров обошла флагманы в задачах на длинный контекст — но только на одном бенчмарке
Авторы честно пишут, что на остальных семи она проигрывает. Разбираемся, что именно они сделали с механизмом внимания и почему это всё равно важно.
Показать полностью+
5
256