Что такое дипфейк. Объясняем простыми словами
Дипфейк — реалистичная подмена фото-, аудио- и видеоматериалов, созданная с помощью нейросетей.
Когда вы смотрите видео, где у модели Dior лицо мистера Бина, а все роли во «Властелине колец» играет Арнольд Шварценеггер, знайте — это и есть дипфейк. Само название deep fake объединяет в себе «машинное обучение» (machine learning) и «подделку» (fake). Компьютерные алгоритмы научились «оживлять» фотографии, синтезировать голос человека, заменять лица на видео. В итоге появляется контент, внешне (почти) неотличимый от настоящего.
Например, в феврале 2021 года в TikTok появился пародийный аккаунт deeptomcruise, в котором выкладывают дипфейки с Томом Крузом. Ролики записывает пародист актёра Майлз Фишер. Его персонаж движется, говорит, поёт без видимых следов наложения одного изображения на другое. В 2020 году приобрёл популярность дипфейк, в котором Илон Маск спел песню «Трава у дома» вместо солиста группы «Земляне».
Пример употребления на «Секрете»
«Помимо фейкньюс мы стоим на пороге новой угрозы — дипфейка, это очень страшная штука. Вот я стою, и вместо меня на компьютере можно вставить другую голову, другой голос. Если всё это оказывается в руках и головах других ребят, вы представляете, сколько они могут наделать вреда?»
(Пресс-секретарь президента России Дмитрий Песков — об опасности дипфейков.)
Нюансы
Для создания дипфейков используют генеративно-состязательные нейросети (GAN). Это алгоритмы на базе машинного обучения, которые генерируют новый контент на основе заданного набора. Например, сети изучают тысячу фотографий Анджелины Джоли и создают новую с чертами и мимикой актрисы. Или накладывают её лицо на видео с другой женщиной.
При этом один алгоритм создаёт видео, а второй пытается определить, настоящее оно или нет. Если второй алгоритм смог обнаружить фальшивку, первый начинает сначала, узнав от алгоритма-напарника о причинах отбраковки. Пара нейросетей действует снова и снова, пока не выдаст результат, который сочтёт достаточно реалистичным.
История
В 2014 году технологию разработал студент Стэнфордского университета Иэн Гудфэллоу. В 2017 году она стала широко известной благодаря пользователю Reddit с ником deepfake, который начал с её помощью заменять лица порноактрис лицами знаменитостей. Вскоре появилась программа, сильно упрощавшая процесс, и порноролики со «звёздами кино» заполнили интернет.
Критика
Технологию критикуют, из-за того что её можно использовать для мошенничества и манипуляций общественным мнением. Например, в 2019 году в США распространилось видео с «пьяной» Нэнси Пелоси — спикером палаты представителей и одним из лидеров Демократической партии. Для видео речь политика замедлили, а затем подключили нейросети, чтобы сделать голос естественным.
В начале 2020 года Facebook объявил об ужесточении борьбы с дипфейками, созданными для введения пользователей в заблуждение. А МВД России в мае 2021 года опубликовало тендер на разработку новой системы распознавания лиц. Программа «Зеркало» должна будет также выявлять дипфейки.
«Дипфейки» против правды: как выглядит дезинформация будущего

В последние годы немало внимания было уделено опасности «фейковых новостей» и дезинформации. По версии словаря Dictionary.com, словом 2018 года стало «misinformation», то есть ложная информация. Впереди мир ожидает новый вызов ‒ так называемые «дипфейки», которые заставят людей буквально сомневаться во всем, что они видят.
11 декабря этого года в российском городе Ярославль открылся форум «ПроэкториЯ». Телеканал «Россия-24» показал кадры с роботом Борисом на сцене, умеющим ходить и говорить.
Автор репортажа констатировал, что робота «уже научили» танцевать, причем «достаточно неплохо». В конце концов Борис оказался простым человеком, переодетым в костюм.
Когда в интернете начали насмехаться над «подставным» роботом, телеканал «Россия-24» удалил сюжет с YouTube-канала, а затем объяснил, что это просто недоразумение, произошедшее из-за «художественного оборота».
«Я был точно уверен, что по аналогии с дедом морозом все вполне точно узнают аниматора в костюме», ‒ пояснил автор сюжета.
Независимо от того, какими именно были мотивы корреспондентов, догадаться, что современный робот ‒ переодетый человек, бдительному зрителю оказалось не так сложно.
Но через несколько лет на любые подобные сомнения придется потратить гораздо больше времени.
Слово 2018 года
Англоязычный онлайн-словарь Dictionary.com определил словом 2018 года «ложную информацию» (misinformation).
«Безудержное распространение неправдивой информации ставит новые вызовы для ориентирования в жизни в 2018 году», ‒ говорится на сайте словаря.
Ложную информацию при этом не следует путать с дезинформацией, «фейковыми новостями» или, например, «дипфейками».
Но в чем разница? В намерениях распространения.
Ложная информация
Ложная информация ‒ та, в которую верят люди, ее распространяющие.
«Это ложные сведения, распространяемые независимо от того, есть ли намерение ввести в заблуждение», ‒ уточняет словарь.
Дезинформация
Дезинформация ‒ это «намеренное введение в заблуждение или предвзятая информация, манипулирование рассказом или фактами, пропаганда», ‒ объясняет словарь.
Если политик стратегически распространяет информацию, не являющуюся правдивой, и политик об этом хорошо знает, в виде публикаций в СМИ, фотографий и т.п., это дезинформация.
Но когда человек видит эту дезинформацию и верит ей, еще и начинает распространять ‒ это становится ложной информацией, поясняет издание The Washington Post.
Следующий уровень ‒ «дипфейк»
Если, казалось бы, словом «дезинформация» удивить кого-то в 2018 году сложно, и даже если люди будут доверять только потому, что увидели собственными глазами ‒ здесь новости тоже неутешительны. Ведь неизбежное появление так называемых «дипфейков» заставит сомневаться буквально во всем, что человек видит на экранах.
Если, например, человек на видео увидит, как президент какого-либо государства выступает с призывом к ядерной войне ‒ при этом он будет выглядеть вполне реалистично ‒ в это, вероятно, поверят.
«Дипфейк» ‒ чрезвычайно реалистичные манипуляции аудио- и видеоматериалами. Слово состоит из двух английских слов: «deep» ‒ глубокий и «fake» ‒ фальшивка».
Иными словами, «дипфейк» ‒ управляемый искусственным интеллектом механизм замещения лица человека на видео лицом другого человека путем машинного обучения ‒ такое определение предлагает один из онлайн-словарей.

«Дипфейки»: как бороться с фальшивыми видео
Пример 1: Обама называет Трампа «засранцем»
В 2018 году американский режиссер Джордан Пил и издание BuzzFeed опубликовали якобы видеообращение бывшего президента США Барака Обамы, в котором он называет Дональда Трампа «засранцем».
На самом деле Обама ничего такого не говорил. Ролик создали с помощью программы Fakeapp и графического редактора Adobe After Effects. Журналисты и режиссер намеревались показать, какой вид в будущем будут иметь «фейковые» новости.
Пример 2: Искусственный телеведущий
А вот, например, государственное информационное агентство Китая «Синьхуа» недавно представило нового, цифрового члена своей редакции ‒ телеведущего, работающего на основе искусственного интеллекта.
Он не является примером «дипфейка», но демонстрирует, как реалистично может выглядеть «цифровой» человек, которому «вложили слова в уста».
«Я буду работать без устали и продолжать информировать вас о последних событиях ‒ тексты загружаются в систему, руководящую мной, непрерывно», ‒ говорит виртуальный журналист.
Обозреватель издания Futurism, правда, замечает: «Пока англоязычная версия телеведущего оставляет желать лучшего. этот конкретный пример никого не сможет обмануть».
Но это ‒ только начало. Со временем такие технологии могут позволить любому создавать видеоролики о реальных людях, где они будут говорить то, чего никогда не говорили, сообщало ранее агентство Associated Press.
Этот высокотехнологичный способ «вкладывать слова в чьи-то уста» станет самым современным оружием в условиях информационных войн, убеждены эксперты.
Есть и плюсы
С одной стороны «дипфейки» могут быть полезным инструментом, например, для обучения: какая-то историческая фигура может рассказывать детям о своей жизни. Но на политической арене использование «дипфейков» будет действительно «пугающим» явлением, говорится в статье Foreign Affairs.
Ведь для чего угодно можно будет привести «реальные доказательства»: будь то выступление мирового лидера, международной организации, акты насилия и тому подобное.
Кровоток соцсетей
Социальные сети, как и с «фейковыми новостями», станут плодородной почвой для циркуляции таких «дипфейков», что будет иметь потенциально опасные последствия для политики. «Попытка России повлиять на американские президентские выборы в 2016 году из-за распространения противоречивых и политически зажигательных сообщений в Facebook и Twitter уже продемонстрировала, как легко можно ввести дезинформацию в кровоток социальных сетей. «Дипфейки» завтрашнего дня будут более яркими и реалистичными, а значит, ими будут больше делиться, чем «фейковыми новостями 2016 года», ‒ замечает автор.

«Дипфейк» – информационное оружие будущего
«Дипфейки» смогут использовать и негосударственные игроки, среди них и террористические группировки, целью которых может быть, например, провокация.
И еще одна проблема
Еще одна проблема в том, что люди со временем будут знать о существовании «дипфейков», и чиновникам, совершившим какое-то правонарушение, будет легко сослаться на то, что это очередная подделка. Более того, люди перестанут верить настоящим записям и будут меньше доверять новостным агентствам.
Самим журналистам тоже будет сложнее ориентироваться в том, что является настоящим материалом, а что «дипфейком», замечает автор.
И хотя технологии для создания «дипфейков» развиваются достаточно быстро, также появляются и ресурсы, имеющие целью их выявлять.
«Но, хотя «дипфейки» и опасны, они не обязательно будут иметь катастрофические последствия. Улучшится система их выявления, прокуроры и истцы иногда будут получать юридические победы против создателей вредоносных подделок, а основные платформы соцсетей постепенно станут лучше в выявлении и удалении мошеннического содержания», ‒ отмечает автор.
Что такое дипфейк и как он используется
Что это? Дипфейк – технология, основанная на работе нейросети, позволяющая замещать лица на фотографиях и видео синтезированными изображениями. Если раньше такие возможности были только у киностудий и игровой индустрии, то сейчас они доступным всем.
Где используется? Дипфейк воспринимается как развлечение. Согласитесь, забавно видеть лицо актера или известного политика в непривычной обстановке, ситуации. Но есть у технологии и более практичные сферы применения.
Что такое дипфейк простыми словами
Многие люди не знают, что такое дипфейк. Это слово было сформировано из двух выражений: deep learning («глубокое обучение» — термин, использующийся в сфере обучения искусственного интеллекта) и fake («подделка, фальшивка»). Таким образом, deepfake — это поддельные видео и фотографии, которые сделаны с использованием искусственного интеллекта. Проще говоря, лицо одного человека заменяется лицом другого.
Данная технология начала активно разрабатываться ещё в конце девяностых. В 1997 году компания Video Rewrite выпустила программу, с помощью которой пользователь мог создать видео, где движения лица синхронизировались с заранее сформированной аудиодорожкой. Таким образом, моделировались артикуляционная мимика говорящего человека.
Что такое дипфейк
Технология совершенствовалась долгие годы. На сегодняшний день человек может обрабатывать голос, объединять компьютерную графику с реальным видео и т.д. В наиболее продвинутых вариантах применяется искусственный интеллект.
Поначалу такие программы не были особо популярны. О них знал только небольшой круг специалистов. Однако в 2009 году вышел фильм под названием «Аватар». Огромное количество зрителей увидели технологию в действии. В 2014 году Одри Хепберн «почувствовала» в рекламной кампании шоколада. Её лицо «перенесли» на лицо актрисы. В фильме «Ирландец» 2019 года выпуска лица актёров сделали гораздо более молодыми при помощи ИИ.
С каждым годом искусственный интеллект становится всё более функциональным. Он может выполнять рутинную работу человека, которому нужно лишь подготавливать исходные файлы и управлять программой. Теперь на видеохостингах можно найти огромное количество дипфейков.
Чтобы создать упрощённую модель лица, подойдет обычная фотография. Это является самым популярным способом создания дипфейков. В этом случае следует сформировать точную 3D-модель исходного лица.
После этого нужно отследить всю его мимику и движения. Затем исходное лицо меняется на другое, однако мимика остается той же. Чтобы добиться хорошего результата, необходимо провести тонкую настройку. Кроме того, потребуются большие процессорные мощности. Если же попытаться упростить задачу, то итоговое видео будет менее качественным.
Изначально создателями дипфейков являлись обычные люди, которые хотели получить видео развлекательного характера. Через некоторое время такой контент начал обрастать своей аудиторией. Теперь люди готовы отдавать свои деньги за подобные ролики. За небольшое видео среднего уровня качества человек может получить как минимум 50 долларов. Дипфейки используются не только для развлечения, но и в качестве инструмента, позволяющего снизить затраты на привлечение реальных актёров.
С точки зрения законодательства такие ролики не нарушают никаких правовых норм, если они не создаются с целью введения зрителя в заблуждение. Если же дипфейк используется для обмана людей, то автора могут привлечь к ответственности. Чтобы избежать юридических проблем, необходимо указать в титрах, что ролик является фейковым.
Причём неважно, какое лицо вы будете использовать в своих видео. Это может быть очень известный человек, который выступает против такой деятельности. Учтите, что доказать причинение вреда дипфейком крайне трудно.
Лидеры рынка дипфейк-технологий
Синтетические медиа — это быстро развивающаяся отрасль, которая интересна многим современным компаниям. К примеру, Amazon постоянно совершенствует голос Алексы, а Disney старается улучшить технологию замены лица в фильмах. Производители оборудования также заинтересованы в подобных решениях. Яркий пример — Nvidia. Эта компания постоянно расширяет границы синтетических аватаров и услуг для кинопроизводства и телевидения.
Большая часть программного обеспечения, использующегося для создания дипфейков, имеет открытый исходный код. Благодаря этому синтетические медиа могут применяться даже небольшим компаниями. К таким проектам относятся Wombo, Аvatarify, FaceApp, Reface, MyHeritage и т.п.
Усложненные версии этих технологий используются в локальных и облачных решениях. Например, Synthesia — крупнейший поставщик синтетических аватаров, которые применяются для обучения, обслуживания клиентов, создания видео и некоторых других задач. Пользователь может работать с готовыми аватарами либо создать свой собственный вариант.
Технология реалистичной генерации голоса используется в самых разных сферах. Например, при работе с клиентами, автоматическом переводе и т.д. Одними из самых успешных компаний в этой сфере являются Respeecher и Resemble AI. В первом случае пользователь может заменить собственный голос голосом другого человека. При этом у него есть возможность настроить возраст и язык. Resemble AI также позволяет клиентам генерировать дипфейки своего голоса.
Лидеры рынка дипфейк-технологий
Variational Autoencoder (VAE) — это генеративная модель, которая нередко используется в данной сфере. Она позволяет создавать новые человеческие лица, генерировать музыку и многое другое. Кроме того, с помощью VAE можно быстро переносить особенности мимики и артикуляции человека на компьютерную 3D-модель. Технология VAE появилась много лет назад, однако сформированные с её помощью ролики легко отличить от настоящих.
В 2017 году были разработаны генеративные состязательные сети (GAN). В этой технологии объединены две нейросети, одна из которых (её называют дискриминатором) оценивает реалистичность модели, сформированной другой нейронной сетью. В результате пользователь получает гораздо более правдоподобный дипфейк.
Скачивайте и используйте уже сегодня:

Топ-30 самых востребованных и высокооплачиваемых профессий 2023
Поможет разобраться в актуальной ситуации на рынке труда

Подборка 50+ ресурсов об IT-сфере
Только лучшие телеграм-каналы, каналы Youtube, подкасты, форумы и многое другое для того, чтобы узнавать новое про IT
ТОП 50+ сервисов и приложений от Geekbrains
Безопасные и надежные программы для работы в наши дни
Однако стоит отметить, что GAN является гораздо более сложной технологией, чем может показаться на первый взгляд. Помимо двух основных, в ней применяются и другие нейросети и элементы. На выходе получается очень реалистичная модель. На сайте This Person Does Not Exist опубликованы примеры работ, созданных с помощью GAN. Там вы можете увидеть лица людей, которые никогда не существовали в реальности.
Данная технология также применялась для создания цифрового двойника Сальвадора Дали. Эта модель используется в музее Дали. Она рассказывает посетителям о биографии и достижениях художника.
6 дипфейк-инструментов, доступных каждому
Поняв, что такое дипфейк, нужно разобраться с инструментами, которые позволяют создавать качественные подделки. Практически все нижеперечисленные программы и приложения не требуют от компьютера больших мощностей.
Doublicat
Платформа: Android / iOS
С помощью этого приложения вы можете создать дипфейк развлекательного характера. Для этого вам нужно лишь сделать селфи и поместить фото на мем или GIF в своей библиотеке. Через считанные секунды ваше лицо будет наложено на лицо Брэда Питта, Леонардо Ди Каприо или Тейлор Свифт.
Получившаяся модель хорошо копирует мимику оригинала. Дипфейк можно отправить друзьям или выложить в социальных сетях.
Учтите, что результат будет выглядеть странно, если использовать модель с большим количеством движений лица. Однако это в любом случае вас позабавит, так что попробовать стоит. Разработчики Doublicat утверждают, что фотография удаляется с серверов сразу после создания дипфейка. Сохраняется лишь представление черт лица.
FaceApp
Платформа: Android / iOS
Это российское приложение создано компанией Wireless Lab. Программа работает на основе нейронных сетей, с помощью которых выполняется преобразование лиц на фотографиях. Результат получается очень реалистичным.
Загрузив в приложение своё лицо, вы сможете поэкспериментировать с его мимикой, возрастом, половой принадлежностью (из-за этой возможности в 2018 году FaceApp привлек много внимания со стороны сексуальных меньшинств) и т.д. Кроме того, программа позволяет накладывать татуировки, фон, виньетки и размытие объектива.
Конфиденциальность пользовательских данных в FaceApp ставится под вопрос. Эта тема не раз обсуждалась в социальных сетях и прессе.
Deepfakes web β
Этот сервис позволяет конструировать дипфейк-видео в режиме онлайн. При этом процесс обучения здесь дольше, чем в других вариантах.
Сначала пользователю нужно пройти регистрацию. После этого необходимо загрузить видео и приступить к работе. Моделирование осуществляется в облаке. Чтобы изучить видео / изображения и смену лиц, придётся потратить около 4 часов. С помощью обученной модели можно изменить лицо за 30-40 минут.
Deepfakes web β
Полученный результат может иметь разный уровень качества. Все зависит от значений «потерь». Чем ниже этот показатель (при обучении из загруженных видео), тем реалистичнее будет модель. Просматривать итоговый дипфейк и учебные данные может только владелец аккаунта.
DeepFaceLab
DeepFaceLab считается одной из лучших программ для создания дипфейков. В ней применяются современные нейросети. Данное ПО можно найти на GitHub.
Разработчики утверждают, что более 95 % высококачественных дипфейков создаются именно в этой программе. Стоит отметить, что DeepFaceLab используется несколькими крупными каналами на YouTube. Например, Ctrl Shift Face, iFake и Shamook.
Чтобы работать с программой, вам потребуются технические знания. DeepFaceLab позволяет использовать большое количество командных файлов. В папке «workspace» размещены все обучающие модели, исходные видео и выходные данные. Программа работает с определенными именами и местоположениями файлов. Благодаря этому пакетный файл может функционировать.
FaceSwap
Платформа: Windows | MacOS | Linux
Эта программа напоминает DeepFaceLab. Однако в FaceSwap больше функций. Кроме того, это ПО предоставляет лучшую документацию и онлайн-поддержку. Ещё одним немаловажным преимуществом FaceSwap является кроссплатформенность (инструмент можно использовать не только в Windows, но и на Mac и Linux).
Программа имеет открытый исходный код. Чтобы работать с дипфейками, вам потребуется производительная видеокарта. В противном случае процесс замены лица будет выполняться очень медленно.
Faceswap работает на Python, Keras и Tensorflow. В интернете можно найти большое количество учебников, которые помогают освоить программу.
Платформа: Android | iOS
Многофункциональное приложение, предоставляющее множество видеоклипов и нарядов. С помощью Zao вы сможете сгенерировать голоса известных людей, наложить на их лица свою фотографию. Вам будет доступно огромное количество причёсок, одежды и макияжа.
Приложение получило большую популярность в 2019 году. Пользователи смогли вставлять свои лица в сцены со знаменитыми актёрами. Буквально за один месяц Zao заняло лидирующую строчку в списке самых скачиваемых приложений в Китае. Однако пользователи много критиковали политику конфиденциальности программы.
Как сделать DeepFake в 4K для синтетических медиа: Часть 1
![]()
Сегодня хотим поделиться с вами нашим опытом создания качественного DeepFake видео в проекте Академия ВХУТЕМАС, который мы реализовывали совместно с RT CREATIVE LAB. В двух частях поговорим о следующем:
- Что такое DeepFake, какие задачи решает, какие базовые подходы существуют;
- На примере проекта расскажем, как мы искали оптимальный pipeline работы с технологией, что попробовали, как выглядит итоговое решение;
- Оставим несколько советов начинающим в этой области специалистам.
В первой части речь пойдет про ключевые вехи развития технологии, про главные инструменты создания DeepFake и про существующие задачи. Всех, кому интересно как сегодня можно создать DeepFake продакшн уровня и не сойти с ума, приглашаем к прочтению.
История DeepFake
Начнем с того, что договоримся об общей терминологии, сделаем краткий исторический экскурс в технологию и составим рекомендации по созданию собственного DeepFake. Итак, история вопроса.
Про данную технологию уже написано несколько хороших исторических обзоров. Отличный обзор про исторический путь технологии можно найти в этой статье (а если нужно больше технических деталей в истории, то вам нужна вот эта статья). Укажем главные исторические вехи, которые привели к сегодняшнему состоянию дел:
1. С появлением аналогового и цифрового видео человечество сразу же попыталась модифицировать кадры в ручную, и таким образом возникла область Analog Image/Video Manipulation.
2. Появляются устройства для цифровой фото и видеосъемки (обзорная статья про развитие цифровой фотографии).
3. Появление первых алгоритмов цифровой обработки изображений и первое применение в кино.
P.S. Минутка полезных ссылок:
Если вас интересует история цифровой фотографии, компьютерной графики и другие связанные темы, то мы настоятельно рекомендуем вам ознакомиться с книгой Mitchell, W.J., 1994. The reconfigured eye: Visual truth in the post-photographic era. Mit Press.
4. Появление Photoshop. Повсеместное распространение технологии.
5. В 1997 году Кристоф Бреглер, Мишель Коувелл и Малколм Слейн (Google) создали инновационную программу Video Rewrite Program, которая была первым примером автоматического анимирования движения губ относительно нового аудио.
6. В 1999 выходит статья A Morphable Model For The Synthesis Of 3D Faces, в которой изложен способ параметрического моделирования геометрии лица человека.
7. В 2001 году в самом разгаре вторая зима ИИ, и большинство работ сосредотачиваются на автоматическом обнаружении и распознавании лиц на основе статистических методов. Выходит модель Active appearance models, которая приобретает популярность у исследователей и практиков. Данная модель позволяет ускорить процедуру обнаружения и обработку лиц на изображениях.
8. Появляется термин Face Swap и выходят первые статьи по этому направлению (без использования глубокого обучения).
9. Наступает новая веха в развитии ИИ и машинного обучения — появляются программные, алгоритмические и аппаратные средства (2013 год). Подробнее про главные вехи развития ИИ можно прочитать здесь.
10. В 2017 году возникает сам термин DeepFake (на Reddit) и появляются первые качественные работы в направлении Face Reenactment — Face2Face, и появляются основные библиотеки Face Swapping и Deep Face Lab.
11. Исследователи начинают использовать GAN модели для коррекции DeepFake — пример: FSGAN.
12. DeepFake получают коммерческое распространение в медиа и рекламе. В качестве примера можно рассмотреть кейс с видеороликом Сальвадором Дали для музея во Флориде. Появился термин Синтетические медиа.
В целом видна тенденция: от технологической базы к алгоритму и к приложению (и так по кругу). Видимо дальше нас ждет движение в сторону улучшения real-time характеристик и создание DeepFake в более высоком качестве с большими деталями.
Как работает простейший Deep Fake?
Конечно, лучшие и самые современные архитектуры Deep Fake (SOTA) устроены достаточно сложно: специфичные функции ошибки, много сложных операторов, сочетание нескольких архитектур и этапов обучения и пр. В следующей части обсудим архитектуру, которую мы использовали в проекте и почему она такая мощная.
Однако, чтобы понять принцип базовых архитектур, которые, например, реализованы в Face Swap или в Deep Face Lab, нужно лишь понимать устройство автокодировщиков (AE / серия заметок про автокодировщики на хабре) или устройство генеративно-состязательных сетей (GAN / заметка с разбором классики на хабре).
Для того, чтобы решить базовую задачу Face Swapping достаточно воспользоваться следующим принципом. Возьмем исходно две одинаковые сети (например, автокодировщики, как на иллюстрации выше) и каждую из них будем обучать на изображениях лица своего человека (лица человека-“источника” (source) будут подстанавливаться на голову другого человека (target)).
С автокодировщиками сеть энкодер (учится из исходных данных извлекать информативные признаки) будет одна и та же для двух лиц, а вот сеть декодер (учится из информативных признаков генерировать данные) будет для каждого лица своя. В процессе обучения сети учатся воспроизводить лица каждая своего человека. Как только они научатся делать это достаточно хорошо, на этапе применения нужно будет оставить исходный энкодер, а декодеры поменять местами (обмен (swapping) лиц осуществляется по сути за счет обмена сетями генераторами).
В зависимости от количества слоев, функции ошибки и наличия разных трюков получаются разные вариации таких базовых архитектур.
Аналогичный обмен можно осуществить между генеративными и дискриминативными сетями в вариации с двумя GAN’ами (иллюстрация ниже).
Конечно, сам процесс обучения является ядровой частью любой DL технологии. Однако, стоит отметить, что помимо этапа обучения, всегда нужно пройти этап препроцессинга данных, который может занимать сопоставимое или даже большее время. Нужно собрать данные (провести съемки или собрать свой датасет или использовать чужой), найти и вырезать в каждом снимке целевые лица, обнаружить ключевые точки, сделать фильтрацию, чтобы избавиться от шумных кадров и пр.
В следующей части заметки мы расскажем про то, как процессы препроцессинга, поиска нужной архитектуры, ее обучения и постпроцессинга выглядели в случае нашего проекта и какого результата нам удалось добиться.
Основные задачи и инструменты DeepFake
Теперь давайте поговорим о задачах и о терминологии. DeepFake глобально — это решение любых задач, в которых на фото, видео или аудио относительно человека происходит подмена или изменение частей данных. Более конкретно, задачи здесь можно разделить на три группы:
- Swapping: обмен местами двух частей данных. Например, если мы меняем лицо одного человека на лицо другого человека, то это Face Swapping.
- Reenactment: управление частями данных за счет явных или неявных сигналов из других данных. Например, если мы хотим чтобы лицо на видео повторяло эмоции и движения губами за другим лицом из другого видео, то это Face to Face video facial reenactment (Face2Face). А если мы хотим чтобы лицо на видео двигало мышцами так, чтобы правдоподобно говорить текст из целевого аудио, то это Voice to Face video reenactment (Synthesizing Obama).
- Detection: определение наличия подмены в данных. Например, если мы по видео пытаемся определить было ли получено лицо в видео с помощью deepfake методов, то это DeepFake Face detection (Video Face Manipulation Detection Through Ensemble of CNNs).
Стоит отметить, что все 3 направления, работают как для разных типов данных (фото, видео, аудио, текст) так и для разных типов контентов (лицо, тело).
Каждая из трех задач имеет свои особенности в плане архитектуры, инструментария и практической постановки задачи, но глобально все проекты можно разделить на две категории: Создание контента и Детекция.
В аналитическом исследовании “Nguyen, T.T., Nguyen, C.M., Nguyen, D.T., Nguyen, D.T. and Nahavandi, S., 2019. Deep learning for deepfakes creation and detection: A survey. arXiv preprint arXiv:1909.11573.” авторы делают именно такое разделение и приводят список полезных инструментов и проектов. Для удобства оставим их здесь в виде таблиц и добавим только самые интересные проекты.
Кстати, эти и многие другие материалы (датасеты, фреймворки, воркшопы и многое другое) можно найти в специальном github list про DeepFake.
Если вас больше интересует тема детекции DeepFake, рекомендуем обратить внимание на этот специализированный github list.
А всем, кого интересуют бизнес аспекты данной технологии (применение в разных областях, аналитика рынка и прочее), мы рекомендуем ознакомиться с подробным и очень понятным отчетом компании SENTINEL: DEEPFAKES 2020: THE TIPPING POINT.
Здесь стоит отметить, что в данном отчете есть одна очень интересная мысль про развитие данной технологии (стр. 35):
- В 2018 году один человек (специалист) мог создать один Deep Fake (высок порог входа и недостаточно вычислительных мощностей).
- В 2021 году миллион человек (не специалистов) могут создавать по одному Deep Fake (порог входа снизился, вычислительные мощности стали лучше, появились более быстрые алгоритмы).
- К 2024 году один человек (не специалист) сможет создавать по миллиону Deep Fake (no code решения при наличии хороших вычислительных мощностей и лучших алгоритмов).
На данном этапе, несмотря на появление более мощных видео-карт и продвинутых алгоритмов, порог входа остается еще достаточно высоким, чтобы технология получила наиболее широкое распространение и заиграла новыми красками. Deep Fake в разных ипостасях — это отличный инструмент в руках творческих людей. Помимо Deep Fake есть еще много других сложных технологий из области 3D ML, но пользоваться ими сейчас могут лишь специалисты, готовые потратить несколько дней своего времени иногда только на настройку окружения.
Для того, чтобы донести технологию качественного Deep Fake и другие 3D ML достижения последних лет, мы решили разработать продукт PHYGITAL+ (вот здесь можно попасть в waitlist), в который поместили тот DeepFake pipeline, про который речь пойдет во второй части заметки, а также много других алгоритмов.