Роботы и автономные системы постоянно ищут способы «видеть» мир максимально эффективно. Fisheye-камеры с их сверхшироким углом обзора кажутся идеальным решением, позволяя охватить почти всё помещение одним кадром. Однако, как показывают недавние исследования, за этот широкий обзор приходится платить значительным снижением точности в одной из ключевых задач компьютерного зрения, монокулярной оценке глубины.
Зачем роботам «рыбий глаз»
Fisheye-камеры, или камеры с эффектом «рыбьего глаза», отличаются экстремально широким полем зрения (Field of View, FOV), которое может достигать 180° и даже более. Это позволяет им захватывать почти всю окружающую сцену за один снимок, минимизируя «слепые зоны». Для робототехники, особенно в задачах автономной навигации, инспекции помещений или создания карт, такая способность критически важна. Один сенсор может заменить несколько обычных камер, упрощая аппаратную часть и сбор данных. Представьте робота, который должен перемещаться по складу, избегая препятствий: широкий обзор позволяет ему «видеть» стены, пол и потолок одновременно, оперативно реагируя на изменения в окружении.
Когда широкий обзор становится проблемой для моделей
Несмотря на очевидные преимущества, широкое поле зрения fisheye-камер создаёт серьёзные вызовы для алгоритмов компьютерного зрения. Исследование показало, что при увеличении FOV со 120° до 195° ошибка некоторых передовых (SOTA) моделей монокулярной оценки глубины увеличивается более чем вдвое на датасете WideDepth. Это означает, что чем шире угол обзора, тем менее точно модель способна определить расстояние до объектов в сцене. Для робота, который полагается на эти данные для построения карты или предотвращения столкновений, удвоение ошибки может стать критическим фактором, ведущим к некорректным действиям или даже авариям.
Суть монокулярной оценки глубины
Монокулярная оценка глубины, это задача предсказания расстояния до каждого пикселя изображения, используя только одно 2D-изображение. Это сложная задача, поскольку глубина, это третье измерение, которое теряется при проекции 3D-мира на 2D-плоскость. Современные глубокие нейронные сети, обученные на огромных датасетах с эталонной глубиной, научились неплохо справляться с этой задачей для стандартных перспективных изображений. Они улавливают тонкие признаки, такие как размер объектов, их текстура, тени и градиенты, чтобы вывести информацию о глубине. Однако fisheye-камеры вносят нелинейные искажения, которые значительно отличаются от привычной линейной перспективы, на которой обычно обучаются эти модели.
Что мешает моделям понять глубину
Основными причинами увеличения ошибки при работе с fisheye-камерами могут быть две ключевые проблемы. Во-первых, это геометрические искажения, присущие самим fisheye-линзам. Объекты, находящиеся ближе к краям кадра, выглядят сильно изогнутыми и растянутыми, что радикально меняет их форму и размер по сравнению с тем, как их «привыкли» видеть модели. Во-вторых, это отличие новых данных от обучающей выборки. Большинство существующих датасетов для оценки глубины состоят из изображений, снятых стандартными камерами с ограниченным FOV и линейной перспективой. Модели, обученные на таких данных, просто не сталкивались с экстремальными искажениями fisheye-изображений и не умеют их адекватно обрабатывать. Без точной эталонной разметки для широкоугольных изображений трудно определить, какая из этих проблем доминирует, или же они действуют в комплексе.
Куда двигаться дальше в оценке глубины
Проблема с fisheye-камерами подчёркивает необходимость в новых подходах. Одним из направлений является разработка специализированных архитектур нейронных сетей, которые изначально будут учитывать нелинейную проекцию fisheye-линз. Возможно, это потребует создания новых слоёв или функций потерь, способных компенсировать искажения. Другое важное направление, это создание обширных и высококачественных датасетов, состоящих из fisheye-изображений с точной эталонной разметкой глубины. Только такие данные позволят моделям полноценно обучиться на особенностях широкоугольной оптики. Решение этой задачи откроет новые горизонты для робототехники, позволяя создавать более «зрячие» и автономные системы, способные уверенно ориентироваться в сложном реальном мире.