Конец эпохи: Голливуд в панике из-за Seedance 2.0
Завирусившийся в сети ролик с дракой Тома Круза ("Том Кукуруз", как его окрестили в народе) и Брэда Питта мгновенно стал символом новой угрозы для киноиндустрии. Видео опубликовал ирландский режиссёр Руари Робинсон, но настоящий резонанс вызвала реакция сценариста Ретта Риза ("Дэдпул", "Добро пожаловать в Zомбилэнд").
"Мне неприятно это говорить, но, скорее всего, для нас всё кончено, - написал Риз. - Очень скоро один человек сможет сесть за компьютер и создать фильм, неотличимый от голливудского. Если этот человек бездарен - получится ерунда. Но если появится талант уровня Кристофера Нолана - результат будет потрясающим".
Seedance 2.0, позиционируемый как значительный шаг вперед по сравнению с ранними text-to-video моделями, позволяет создавать сложные сцены с реалистичной физикой, динамикой камеры и монтажом. Пользователи уже демонстрируют чудеса: один из авторов создал эпичную битву драконов всего за 30 минут, используя лишь пять референсов, тогда как раньше на подобную CGI-сцену потребовались бы миллионы долларов и работа целой VFX-студии.
Однако именно лёгкость генерации узнаваемых актёров и сцен в стиле известных фильмов вызвала гнев Голливуда. Ассоциация кинокомпаний (MPA) и профсоюз актёров SAG-AFTRA выступили с резкой критикой, обвинив ByteDance в «несанкционированном использовании защищённых авторским правом произведений в массовом масштабе». Глава MPA Чарльз Ривкин потребовал от компании прекратить нарушения и внедрить механизмы защиты интеллектуальной собственности.
Британский режиссёр и член Палаты лордов Бибан Кидрон призвала ИИ-сектор к переговорам, предупредив, что в противном случае отрасль ждёт "десятилетие судебных тяжб". В ByteDance пока никак не комментируют ситуацию.
Стоит отметить, что, несмотря на впечатляющую картинку, у нейросетей остаются проблемы с сохранением образа персонажей в длинных сценах и реализацией диалогов. Однако с экшеном и физикой Seedance 2.0, судя по всему, справляется блестяще. Социальные сети уже начали наполняться подобным "слопом" (ролики, сгенерированные нейросетью), и хотя до полноценного кинематографа пока далеко, индустрия понимает: точка невозврата пройдена.
1. "Никода не будет нормально рисовать пальцы и зубы, ха-ха"
2. "Никогда не будет делать нормальную физику, ха-ха"
3. "Никода не будет делать одинаковых персонажей, ха-ха-ха"
4. "Никогда не будет делать ролики больше 5 секунд с хрошим качеством, ха-ха"
Что следующее придумаете? Теперь про "неуникальный сюжет" и "бездуховность" новые байки пойдут, да?
Кстати, спрашивал у Клода, чем вызваны такие ограничения по хрону. Причина оказалась в ограничениях текущей архитектуры диффузионных моделей. Высокое разрешение в латентном 3Д пространстве и длительность экспоненциально увеличивают потребляемую память. В качестве решения предлагает смену архитектуры на базовом уровне, адаптивную BVH-иерархию, динамичный монтаж, улучшение алгоритмов апскейла.
Остальные пункты решаются улучшением ML и вспомогательной LLM для диффузионной модели.
Ну вот подобный комментарий видел сравнительно недавно, когда была здесь статься про Sora 2. Ответил примерно так, что это вопрос времени.
Нет никаких сомнений, что и полный метр скоро смогут генерировать.
Маск даже обещал к концу этого-началу следующего года. Но слова Маска мы принимаем с настороженностью. Но самый очевидный тут выход - генерировать фильм как "раскадровку" по сценам + набор обобщенных данных (внешний вид предметов и персонажей) некое формальное описание (как сценарий, но чуть более подробно, включая описание эмоций, углов камеры, параметров освещения, какая одежда на персонаже в данной сцене, какого цвета у него авто и т.п. - тоже генерируется моделью). А затем на всем этом запускаем параллельно скажем 1000 копий модели, каждая из которых работает строго со своим фрагментом, беря заранее сгенерированный кадр и описание. Если это все дело запусать параллельно, и есть достаточно ресурсов для этого, то можно весь фильм за несколько минут сгенерировать, от и до. Никаких принципиальных проблем нет. Есть некоторое недопонимание в том, какие данные и в каком формате передавать между сценами (а еще хорошо бы эти наборы иметь возможность для каждой сцены вручную редачить - свет там поправить, атмосферу, прическу у ГГ). Вот в этом сейчас основной затык. Ну и ресурсы, конечно. Один фиг много потребуется. Тут ждем другие архитектуры или использование нейроморфных чипов (энергоэффективность выше в 100-1000 раз при сравнимом качестве). Вот тогда да, тогда станет даже не то что реально, станет просто выгодно, и тут людям предложить нечего, вряд-ли кто сможет клонироваться на 1000 копий, чтобы в конкурентные с ИИ строки делать фильмы.
Технология, честно говоря, поражает. Ну и немного пугает. Точнее пугает не технология, а люди ее использующие. Технология сама не имеет ни мотивации ни сверхцели.
Все правильно.
Тут та-же проблема что и с LLM. Оседлали не те варианты у которых больше возможностей, а те, которые смогли запустить в ограниченные сроки. Но даже текущие алгоритмы довольно неплохо модифицируются и улучшаются, причем даже так, как их создатели изначально не предполагали. Диффузионные модели в принципе неплохи на своем фронте задач, и, при некоторых условиях, неплохо тайлятся (паралеллятся), что частично проблему решает. Они же могут выступать своеобразными "рендерами" отдельных чанков по данным, предварительно подготовленным другими моделями. Там единственное что, нужны дополнительные "каналы" хранящие не просто пиксели, но и фильмо-специфичные данные как в обычных проходах рендера (глубина, освещенность, принадлежность к объекту по ID и прочие). Но это нужно сначала датасеты подготовить для обучения. Больше проблема в этом пока. Подготовка данных под новую задачу для ИИ занимает чаще больше времени чем сам цикл обучения.
Но решений, даже приблизительных, целый вагон вырисовывается. Т.е кто пишет что "скоро будет зима ИИ" не разбираясь в теме вызывают недоумение, в лучшем случае. Я когда такого человека встречаю, который до сих пор про 6 пальцев хихикает, понимаю что у него что-то там поломано в голове и лучше с такими вообще дела не иметь.
"Зима ИИ" может и будет, но не в ближайшие лет 10. Но за это время мы можем и до сингулярности дойти или вымереть
В вашем варианте мы просто заменяем болванку ее формальным описанием. Представьте себе два мира. В одном вы ставите человечка-манекена в нужную позу и делаете его снимок. Это "болванка" в вашем понимании. В другом мы берем, и для каждого сустава этого человечка описываем на сколько градусов каждый сустав повернут. Это "болванка" в моем понимании. Чисто по результату в них нет разницы. Но с первой намного сложнее оперировать, так как для этого нужен полноценный CV, а во втором случае у нас несколько сотен чисел. Чуете разницу в объеме обрабатываемых данных при эквивалентном одинаковом внешнем результате? Если что-то нужно исправить (подвинуть руку), в первом случае нужно картинку перерисовать и опять распознать, а во втором - поменять несколько чисел. Первый вариант мы вообще не можем варьировать в смысле семантики, нам нужны опять пиксели, а во втором эти значения поворотов суставов можно даже перебирать через рандомизатор, при этом маленькая, совсем крошечная нейросетка может быть добавлена в систему чтобы сигнализировать о невозможных поворотах суставов. В первом случае это невозможно. При этом, повторю, результат будет одинаковый, а объем данных - на несколько порядков меньше. Первый вариант не имеет в себе метаданных, второй - имеет, любые какие захотите,вплоть до описания характера персонажа закодированного таким образом и что у него лежит в правом заднем кармане брюк. Как быть в первом случае? А это важно, если вы хотите консистентность. И к тому-же тут модель оперирует смыслом, а не пикселями. А мы же не хотим просто набор красивых пикселей, мы же хотим смысл, вот это вот все, правильно? И впервом случае нейронка вам не поможет, и уж тем более ничего не сделает самостоятельно, ей надо будет постоянно тыкать что где. а во втором - вполне сделает всю работу от и до.
Можно, если не интересует, например, полный контроль - нейронка не выдаст гудини файл со слоями и накрученными плагинами. В нормальную топологию и UV развёртку 3D моделей ии тоже пока не может. Помнится, все говорили - 3D убьёт кинематограф. Лет 20 прошло - а модели как были "анимированными мертвецами", так и остались. Ну научат ии делать пять пальцев, будет она продвигаться и развиваться, а также всё будет узнаваться по едва уловимым признакам. Но тем ценнее, как мне кажется, станет работа человека.
• Заказчик уже не ждал свой авторский портрет, а просто делал снимок и получал быстрый результат.
• Одна часть художников переквалифицировались в другие направления или вообще меняли род деятельности;
• Другая часть отсеялась, которая изначально искала финансовой выгоды;
• Ну, и в сухом остатке остались те самые Художники с большой буквы, которые приняли новое веяние прогресса, не стали бороться за место под солнцем, а взяли, пересмотрели искусство и создали нечто новое (пример, Дали, Пикассо, Шагал и т.д.)
Так что, уважаемые, желаю вам не бороться с ветряными мельницами, а принять для себя, что есть такая технология, как ИИ, и создавайте искусство! С Богом! И будьте здоровы!
вот что реально было бы полезно в кинопроизводстве, а не вот эта чушь.
это захват движения с реального исполнителя (или с другого реального видео, заготовки, болванки) с последующей подменой его движений на генеративный ИИ.
но конечно при условии что результат подконтролен творцу.
таким образом режиссура эпизода, монтаж и нюансы вроде ракурса камеры и операторской работы остаются за человеком. по факту - при таком сценарии развития событий всем нашлось бы место. и актерам, и режиссеру, и оператору, и разработчикам нейросетей.
и новые технологии развиваем, и человеческая актерская игра на месте, и все остальные при делах.
человек создает намётку, в каком направлении двигаться, а нейронка делает так называемую рутинную работу (в случае со спецэффектами).
если бы оно двигалось хотя бы в этом направлении, было бы очень хорошо.
а если бы еще послойную генерацию делали...
может утопия, но тем не менее...
С компа посмотрите и впечатлитесь.
Это не глупость - это хитрожопость, умение использовать чужой труд для достижения собственных целей. А ИИ - это просто замечательный объект эксплуатации, гораздо более удобный, чем человек.
Ещё большое значение в этом вопросе имеет целеполагание: "создать что-то" и "получить что-то" - это две огромные разницы. Увы, но получать профит более лёгким путём едва-ли когда-нибудь станет стыдным.
Кроме того, вся история человека разумного - это история компенсации собственных слабостей и недостатков с помощью всевозможного переферийного оборудования и окружающих.
Во-первых, там делается вывод касательно только части модели. Вот, предположим, человек понимает, что написано на листе бумаги, и даёт осмысленный ответ. А его зрительная кора понимает и другая часть мозга, которая отвечает, предположим, за моторику при написании ответа? Или же они просто "механически" передают некие сигналы и выполняют инструкции от другой части мозга?
Во вторых, надо ещё доказать хотя бы теоретическую возможность существования такой "инструкции", которая способна покрыть "любые осмысленные вопросы", при этом не давая исполнитель возможности для обучения. Конечный справочник, типа разговорника для туриста - легко. А вот "любой" - это уже весьма сильное заявление. (Если только это не китаец, спрятанный в секретере.)
А ещё неплохо бы посадить в соседнюю комнату настоящего китайца, безо всяких инструкций, и тоже позадавать ему "любые осмысленные вопросы".
Человеческий разум как-то уж слишком сильно сакрализируется, особенно если речь заходит о творчестве и эмоциях. Но так-ли уж принципиально неповторима эта система? Человек, без определённого массива обучающих данных, - это просто набор примитивных животных инстинктов. Чтобы понимать, мы сохраняем взвешенные взаимосвязи между различными входными данными. Чтобы общаться, мы сначала запоминаем, а затем комбинируем и трансформируем речевые паттерны. Творчество, как уже говорилось ранее, - это поиск хороших комбинаций ранее запомненных входных данных. А для пущего разнообразия, у нас есть как-попало сформировавшаяся аппаратная архитектура, которая ещё и каждый раз воспроизводится с рандомными настройками.
btw, А может-ли человек, не испытывающий эмоций, но достаточно наблюдательный и отлично владеющий мимикой, имея достаточно хорошую "инструкцию по применению", научиться имитировать эмоции достаточно хорошо и уместно, чтобы у большинства окружающих создавалось впечатление, что он действительно "чувствует"?..
Может-ли человек, не испытывающий эмоций, но достаточно наблюдательный, имея достаточно хорошую "инструкцию", научиться логически, исходя из контекста ситуации, мимики, "языка тела", понимать что чувствуют окружающие с достаточно хорошей точностью?
Инопланетяне, раз в 1К лет залетающие на Землю:
- "Они никогда не нарисуют правдоподобную фигуру кого-либо"
- "Не, они быстрее вымрут, чем смогут в реализм"
Вот мой подробный разбор того, что здесь происходит, по ключевым темам:
### 1. Главный спор: "Замена против Инструмента"
Это центральная линия конфликта в комментариях.
* **Сторонники "Замены" (или "Революции"):**
* **Дмитрий Волоснихин** и **Kirill none** — самые яркие представители этого лагеря. Они приводят исторические примеры (пальцы, зубы, физика), которые ИИ уже "победил". Они смотрят на проблему технически: ограничения текущих архитектур (диффузионные модели, память) — это временные трудности, которые будут решены сменой парадигм (нейроморфные чипы, BVH-иерархии).
* **Александр Родионов** верит, что ИИ сможет имитировать актерскую игру, проанализировав весь мировой кинематограф. Для него "китайская комната" не аргумент, важен результат на выходе.
* Их главный тезис: **ИИ сделает производство контента мгновенным и дешевым, изменив экономику индустрии до неузнаваемости.**
* **Сторонники "Инструмента" (или "Эволюции"):**
* **Михаил Круглов**, **Артём Власенко**, **Сергей Метельский** и **Иван Афанасьев** представляют эту точку зрения.
* **Михаил Круглов** и **Артём Власенко** указывают на фундаментальные проблемы: отсутствие понимания физики мира ("картины мира"), неконтролируемые артефакты и невозможность создать принципиально новое (актера уровня Джима Керри) на основе только старого.
* **Сергей Метельский** бьет в самую больную точку продакшена — **отсутствие контроля и предсказуемости**. В профессии нужно получить *конкретный* результат, а не просто "красивую картинку".
* **Иван Афанасьев** апеллирует к философии ("Китайская комната"), утверждая, что машина не способна на подлинное чувство и понимание.
* Их главный тезис: **ИИ — это мощный инструмент для рутины и генерации идей, но финальный контроль и "душа" останутся за человеком.**
### 2. Ключевые идеи и "болевые точки"
* **Проблема консистентности и контроля:** Самый сильный аргумент "скептиков". **Andrew Ф (Cake)** и **Сергей Метельский** справедливо замечают, что генерация "с нуля" — это тупиковый путь для серьезного производства. Нужна интеграция в существующие пайплайны. Andrew предлагает "анимированные болванки", а Дмитрий Волоснихин развивает эту мысль до формального описания сцены числами (метаданные), что дает гораздо больше возможностей для контроля и редактирования, чем работа с пикселями. **Это, пожалуй, самый конструктивный технический спор в ветке.**
* **Кризис контента:**
* **Пашка Танков**, **Max Ili** и **Dina Felis** поднимают важную тему: Голливуд и так давно болен. Он переполнен сиквелами, римейками и "проходняком". Получается, ИИ приходит не в цветущий сад, а на выжженную землю. С этой точки зрения, ИИ — просто более эффективный производитель того самого "мусора", который индустрия штамповала и раньше.
* **Социальный и экономический аспект:**
* Первый комментарий ("Откуда бы ему появится, если "джуны" больше не нужны") — это крик души о разрыве поколений в профессии. Если рутинные задачи, на которых учатся новички, будет делать ИИ, то откуда возьмутся новые мастера?
* **Михаил Трапезников** и ответ **maniacalipsis** затрагивают тему "хитрожопости" и демократизации творчества. ИИ позволяет "необразованным" людям создавать контент, что приводит к затоплению рынка мусором, но также дает шанс тем, у кого есть идеи, но не хватает технических навыков.
* **Философский вопрос: "Может ли машина чувствовать?"**
* Спор **Александра Родионова** и **Ивана Афанасьева** об актерской игре — это классический спор о сильном и слабом ИИ. Родионов придерживается утилитарного подхода: "если выглядит как утка и крякает как утка, то какая разница?". Афанасьев настаивает на принципиальной разнице между имитацией и переживанием. Развернутый комментарий **maniacalipsis** про китайскую комнату — отличная иллюстрация того, что этот вопрос далеко не так однозначен.
### Итог и мое мнение
Эта дискуссия — отличный срез текущего момента. Ни одна из сторон не является полностью неправой.
1. **Правы "оптимисты" (вроде Дмитрия и Kirill none)** в том, что технические ограничения — это вопрос времени. Качество генерации будет расти, артефакты уйдут, длинные ролики станут реальностью. ИИ действительно изменит производственный процесс до неузнаваемости.
2. **Правы "скептики" (вроде Сергея Метельского и Артёма Власенко)** в том, что фундаментальные проблемы контроля, консистентности и "понимания мира" пока далеки от решения. Текущий подход "статистического попугая" (пусть и очень продвинутого) не гарантирует появления настоящего *автора*.
3. **Правы "критики индустрии" (вроде Пашки Танкова)** в том, что ИИ приходит в уже больную систему. Он не убьет "великое кино", потому что его и так почти нет. Он убьет "ремесленный конвейер", который производил 98% "проходняка".
**Что будет дальше?**
Скорее всего, нас ждет расслоение. Появится огромный пласт ultra-fast, ultra-cheap контента, сгенерированного ИИ (для соцсетей, рекламы, простых сериалов). Классическое кино, скорее всего, никуда не денется, но станет еще более нишевым и дорогим удовольствием (как театр или hand-made искусство), где ценность будет определяться именно человеческим участием, контролем и "душой". **Зорикто Ардуев** очень точно провел аналогию с появлением фотографии — художники не вымерли, а переосмыслили свое место.
А проблема "джунов", о которой сказано в самом первом комментарии, — это, пожалуй, самый тревожный и пока не имеющий ответа вопрос.