NeoMME: Эффективный мультимодальный и многоязычный энкодер
Введение
В данной статье мы представляем NeoMME, семью мультиязычных мультимодальных энкодеров с размерами 260M и 800M. В отличие от многих генеративных визуально-языковых моделей, NeoMME не использует отдельную предобученную визуальную башню или каузальную языковую модель. Вместо этого, единственный двунаправленный трансформер обрабатывает как текстовые токены, так и сырые изображения, и мы тренируем всю модель с нуля с использованием метода маскированной дискретной диффузии.
Преимущества NeoMME
Мы дообучили NeoMME для визуального извлечения документов, используя подход ColPali с изображениями страниц. NeoMME-Retriever возвращает плотные и поздние взаимодействия эмбеддингов за один проход. Оба размера модели находятся на границе Pareto ViDoRe v3 для nDCG@10 и размера модели. При совпадающем размере входного изображения 2048×2048 на NVIDIA L40S GPU модель 260M кодирует около 51 страницы в секунду, что в два раза больше, чем производительность ColModernVBERT.
Уменьшение хранилища индекса
Иерархическое пуллинг токенов и асимметричная квантизация уменьшают размер хранилища позднего взаимодействия индекса с примерно 1.5 MB до 6 kB на страницу (255 раз меньше), сохраняя при этом более 95% базовой nDCG@10.
Доступность NeoMME
NeoMME доступен в Hugging Face Transformers. Мы публикуем все контрольные точки модели под лицензией Apache 2.0.
Почему еще один мультимодальный энкодер?
Многие современные визуальные документные ретриверы адаптированы от предобученных генеративных визуально-языковых моделей. Отдельно предобученный визуальный энкодер создает визуальные характеристики, которые проектор переводит в пространство ввода языковой модели. Однако, извлечение, классификация и маркировка токенов не требуют каузального декодера.
Архитектура NeoMME
NeoMME (произносится как "ни-о-ме") является многоязычным мультимодальным базовым энкодером, который генерирует векторные представления для входных текстов и/или изображений с использованием единого энкодера трансформера. Он не основан на существующих предобученных визуальных башнях, текстовых энкодерах или декодерах.
Технические особенности
- Нативный мультимодальный ввод: текстовые вводы используют факторизованные токенные эмбеддинги, а изображения делятся на сетку неперекрывающихся 32×32 патчей.
- Динамическое разрешение изображений: изображения сохраняют свои соотношения сторон и размеры, что позволяет модели использовать больше токенов на высокоразрешающей странице документа.
- Долгий двунаправленный контекст: оба модели имеют длину контекста в 16,384 токена.
Обучение на изображениях через маскированный текст
Мы предобучаем NeoMME с нуля как дискретный маскированный диффузионный денойзер текста. Для каждого примера только с текстом мы равномерно выбираем уровень коррумпированности от 0 до 1. Каждый подходящий текстовый токен затем независимо маскируется с этим уровнем.