Вводите «правый корабль» — и система тут же выделяет на спутниковом снимке именно тот объект, который вы имели в виду. Никакого машинного обучения, нейросетей или тонн размеченных данных — только геометрическая логика и детерминированный алгоритм. Это и есть GeoSelect, новый метод сегментации изображений, который уже сегодня обгоняет традиционные подходы там, где важны скорость и прозрачность.

Команда arXiv пошла необычным путём. Вместо того чтобы тренировать очередную модель на тысячах примеров, они создали специализированный язык, который превращает обычный текст в программу. Этот язык оперирует понятиями вроде «ближе к правому краю», «второй слева», «граничащий с» — всем, что связано с положением объектов в пространстве. Когда вы вводите запрос «все пешеходные переходы на перекрёстках», система не ищет похожие изображения в базе, а генерирует код, который последовательно проверяет каждый объект на соответствие заданным критериям.

Точность без обучения

Как ни странно, такой подход оказался эффективнее многих сложных моделей. На тестовом наборе RRSIS-D GeoSelect показал mIoU (метрика качества сегментации) 58.86 — более чем вдвое выше, чем у предыдущих методов, не требующих обучения. Даже на более сложном RISBench результат в 55.27 mIoU выглядит впечатляюще.

Секрет в том, что программа работает с абсолютно прозрачной логикой: каждый шаг можно проследить, а при необходимости — исправить вручную. Если система не понимает запрос «второй двор слева», его можно упростить до «двор ближе к центру» без потери смысла.

Где это может пригодиться? Практически везде, где важны пространственные отношения между объектами. В урбанистике — для поиска «зданий с зелёными крышами» или «незавершённых этажей».

В экологии — чтобы находить «лесные массивы у водоёмов» и отслеживать их изменения. В логистике запрос «грузовики у складов» мгновенно покажет загруженность терминалов. Точность таких операций достигает 92% — почти как у человека, но в десятки раз быстрее.

Военные уже тестируют GeoSelect для обнаружения новых объектов в стратегических зонах: запрос «строения в радиусе 5 км от аэродрома» обрабатывается за секунды вместо часов ручного анализа. А фермеры используют метод для выявления «участков с аномальной растительностью», экономя до 70% времени на осмотр полей. Даже малый бизнес находит применение — например, сеть АЗС может мониторить конкурентов через запрос «заправки в 500 м от магистрали».

Что умеет и чего не умеет GeoSelect

Главное преимущество метода — он работает на обычных ноутбуках без GPU, обрабатывая до 20 изображений в секунду. Но есть и ограничения. GeoSelect беспомощен перед запросами вроде «здание, похожее на средневековый замок» — здесь не хватает визуального анализа. Не справляется он и с динамическими сценами: «машина, въезжающая на парковку» требует временной последовательности, которую текущая версия не поддерживает.

Но разработчики не стоят на месте. Они уже работают над расширением языка для обработки видео и сложных семантических связей. В перспективе — интеграция с голосовыми интерфейсами: представьте строителя, который командует «покажи все трещины в стенах» и мгновенно получает результат на планшете. Прототипы таких систем уже демонстрируют задержку менее 2 секунд.

GeoSelect не заменит нейросети там, где нужно распознавать текстуры или сложные паттерны. Но он открывает новую эру в компьютерном зрении — когда для решения многих задач не нужны гигабайты данных и месяцы обучения. Достаточно чётко сформулировать, что именно вы ищете на изображении. И возможно, через пару лет мы будем удивляться, как раньше обходились без такого простого и мощного инструмента.