World Labs представила Atlas: модель управляет камерой в видео и отдаёт сцену явной 3D-геометрией
Компания World Labs из Сан-Франциско объявила Atlas — модель, которая берёт на себя сразу четыре задачи, обычно разнесённые по разным инструментам: генерацию изображений и 360-панорам по тексту, генерацию видео с управлением камерой, реконструкцию реальных сцен по фотографиям и симуляцию пространства и времени по видеозаписи. Разработчики называют её моделью мира: генерация, реконструкция и симуляция объединены в одном контуре.
Для тех, кто занимается графикой, ключевой пункт спрятан в описании реконструкции. Atlas выдаёт кадры с новых ракурсов и одновременно явные 3D-выходы — результат можно забрать в сцену, а не только смонтировать как видео.
Камера как входной параметр
Режим Camera-Controlled Generation принимает один или несколько снимков и заданные положение и угол камеры, а на выходе даёт видео длительностью до минуты в разрешении 1440p. По описанию World Labs, камера задаётся как точная геометрия, а не текстовой инструкцией, и траектория облёта проектируется заранее: в показанных примерах путь камеры прокладывали вручную.
Минута непрерывного материала в 1440p — это уже длина, пригодная для превиза, анимационных вставок, фона или заготовки под композитинг. Для превизуализации и питчинга такой формат закрывает значительную часть задач без построения сцены вручную.
От одного кадра до нескольких десятков снимков
Режим Spatial Reconstruction восстанавливает реальную сцену по количеству изображений от одного до нескольких десятков. Atlas генерирует кадры с новых точек обзора и параллельно — явное 3D-представление сцены; на официальной странице модели указано, что результат выгружается облаком точек или гауссовыми сплатами.
Это меняет привычную процедуру съёмки под фотограмметрию. Классические пайплайны требуют плотного покрытия объекта десятками и сотнями кадров с перекрытием, аккуратным светом и без движущихся объектов. Модель, которой достаточно горстки снимков, снимает часть этих требований — цена за это, судя по природе генеративного подхода, в том, что недостающие участки сцены дорисовываются, а не измеряются; World Labs прямо указывает, что невидимые на входе области Atlas додумывает, и чем больше снимков подано, тем меньше домысливания. Для набросков окружения, референсов и быстрых цифровых двойников площадки такой размен оправдан, для точных обмеров — вряд ли.
Симуляция пространства-времени и рефрейминг отснятого материала
Третий режим, Space-Time Simulation, моделирует пространство и время по входному видео. World Labs называет два применения: перекадрирование уже снятого видео для задач визуальных эффектов и сценарии Real-to-Sim в робототехнике — перенос реальной сцены в симуляцию.
Первое напрямую касается постпродакшна: кадрирование и точку съёмки можно изменить постфактум, по материалу с нескольких обычных камер. Второе показывает, что аудитория модели не ограничивается кино и играми: те же данные о геометрии и динамике сцены нужны разработчикам роботов.
Четвёртый режим — генерация изображений и 360-панорам по тексту с поддержкой сложных промптов и разных визуальных стилей. Панорамы применимы как продакшн-формат: окружение, скайбокс, фон для реалтайм-сцены.
Кто уже может попробовать
Свободного доступа нет: заявку на ранний доступ к Atlas оставляют на сайте компании. Тарифы и сроки публичного релиза World Labs не объявляла. Демонстрацию возможностей модели компания показала в ролике.
Почему разрозненные инструменты начали собирать в одну модель
Последние годы генеративные инструменты для графики развивались как набор узких специалистов: отдельно видеогенераторы, отдельно решения для восстановления геометрии по фотографиям, отдельно генераторы текстур и панорам. Художнику приходилось сшивать их вручную, теряя качество и время на каждом стыке. Заявка Atlas — обратное движение: одна модель, обученная работать с текстом, изображением, видео и трёхмерными данными сразу, чтобы результат одного режима был пригоден как вход для другого.
Вероятно, за этим стоит и накопленный интерес индустрии к гауссовым сплатам: формат за несколько лет прошёл путь от исследовательской темы до поддержки в коммерческих пакетах, и генеративная модель, отдающая сплаты напрямую, попадает в уже подготовленный пайплайн. Если тенденция продолжится, разница между генерацией видео и сборкой сцены будет стираться, а от моделлеров потребуется больше работы по отбору, чистке и досборке сгенерированной геометрии.
Осторожность здесь уместна: пока модель живёт в закрытом раннем доступе, судить о её поведении на реальном производственном материале — сложных отражениях, мелкой геометрии, съёмке в движении — нельзя. Понятно другое: конкуренция среди генераторов видео смещается от качества картинки к контролю над камерой и к возможности вытащить из результата трёхмерную сцену.