На демостраційному ролику все виглядає круто, але в реальності є певні недоліки (компенсуються навченістю екіпажу).
1. Низька роздільна здатність
Модель навчалась на зображеннях розміром 1024 х 1024 пікселів. Тому, коли ви генеруєте шматок зображення на вашому фото, яке може бути значно більшим, генерована частина все одно не буде більшою за 1024 по найбільшій стороні. Тому вона буде просто розтягуватись. Поки що єдиний вихід - генерувати зображення шматками не більше за 1024 на 1024 пікселів.
2. Присутність артефактів
Іноді під час генерації виникають артефакти. Цю проблему можна виправити, перегенерувавши частину, на якій з'явились артефакти.
2. Обличчя та руки
Проблема багатьох нейронок. Я поки не тестував нововведення самостійно, тому не можу сказати, наскільки реально позбутись цієї проблеми. В тому ж Stable Diffusion це, зазвичай, вирішується інпеінтом (перегенерацією обраного шматка зображення).
Підсумки
Потрібно розуміти, що це лише перші кроки з інтеграції нейронної генерації у Фотошоп, тому якість роботи буде лише покращуватись з часом. Проте, вже зараз можна відмітити як круто модель генерує, враховуючи перспективу і освітлення оригінального зображення.
Файрфлай найкраще з текстовими ефектами працює