PromptPilot

NeoMME: Эффективный мультимодальный и многоязычный энкодер

8 сентября 2026 г.

Введение

В данной статье мы представляем NeoMME, семью мультиязычных мультимодальных энкодеров с размерами 260M и 800M. В отличие от многих генеративных визуально-языковых моделей, NeoMME не использует отдельную предобученную визуальную башню или каузальную языковую модель. Вместо этого, единственный двунаправленный трансформер обрабатывает как текстовые токены, так и сырые изображения, и мы тренируем всю модель с нуля с использованием метода маскированной дискретной диффузии.

Преимущества NeoMME

Мы дообучили NeoMME для визуального извлечения документов, используя подход ColPali с изображениями страниц. NeoMME-Retriever возвращает плотные и поздние взаимодействия эмбеддингов за один проход. Оба размера модели находятся на границе Pareto ViDoRe v3 для nDCG@10 и размера модели. При совпадающем размере входного изображения 2048×2048 на NVIDIA L40S GPU модель 260M кодирует около 51 страницы в секунду, что в два раза больше, чем производительность ColModernVBERT.

Уменьшение хранилища индекса

Иерархическое пуллинг токенов и асимметричная квантизация уменьшают размер хранилища позднего взаимодействия индекса с примерно 1.5 MB до 6 kB на страницу (255 раз меньше), сохраняя при этом более 95% базовой nDCG@10.

Доступность NeoMME

NeoMME доступен в Hugging Face Transformers. Мы публикуем все контрольные точки модели под лицензией Apache 2.0.

Почему еще один мультимодальный энкодер?

Многие современные визуальные документные ретриверы адаптированы от предобученных генеративных визуально-языковых моделей. Отдельно предобученный визуальный энкодер создает визуальные характеристики, которые проектор переводит в пространство ввода языковой модели. Однако, извлечение, классификация и маркировка токенов не требуют каузального декодера.

Архитектура NeoMME

NeoMME (произносится как "ни-о-ме") является многоязычным мультимодальным базовым энкодером, который генерирует векторные представления для входных текстов и/или изображений с использованием единого энкодера трансформера. Он не основан на существующих предобученных визуальных башнях, текстовых энкодерах или декодерах.

Технические особенности

  • Нативный мультимодальный ввод: текстовые вводы используют факторизованные токенные эмбеддинги, а изображения делятся на сетку неперекрывающихся 32×32 патчей.
  • Динамическое разрешение изображений: изображения сохраняют свои соотношения сторон и размеры, что позволяет модели использовать больше токенов на высокоразрешающей странице документа.
  • Долгий двунаправленный контекст: оба модели имеют длину контекста в 16,384 токена.

Обучение на изображениях через маскированный текст

Мы предобучаем NeoMME с нуля как дискретный маскированный диффузионный денойзер текста. Для каждого примера только с текстом мы равномерно выбираем уровень коррумпированности от 0 до 1. Каждый подходящий текстовый токен затем независимо маскируется с этим уровнем.