Hunyuan 3.0: обзор нейросети Tencent для генерации изображений, 3D-моделей и текста

Подробный обзор Hunyuan 3.0 от Tencent: возможности генерации изображений, 3D-моделей и языковой модели. Архитектура, бенчмарки, условия использования и практические примеры.

Что такое Hunyuan 3.0 и чем она отличается от других нейросетей

Hunyuan 3.0 — это семейство моделей искусственного интеллекта, разработанное компанией Tencent. В отличие от многих других нейросетей, Hunyuan 3.0 не является единой моделью, а представляет собой набор специализированных решений: для генерации изображений (HunyuanImage 3.0), для создания трёхмерных объектов (Hunyuan3D 3.0) и для работы с текстом (языковая модель Hy3 Preview).

Ключевое отличие Hunyuan 3.0 от конкурентов — открытый исходный код и либеральная лицензия. Модели можно скачать, запустить локально или использовать через облачные сервисы. Это делает технологию доступной не только крупным корпорациям, но и небольшим студиям и независимым разработчикам.

Ещё одна важная особенность — архитектура Mixture-of-Experts (MoE). Вместо того чтобы задействовать все параметры модели для каждого запроса, MoE активирует только часть «экспертов», специализирующихся на конкретной задаче. Это позволяет добиться высокой производительности при относительно скромных вычислительных затратах.

HunyuanImage 3.0: генерация изображений с пониманием контекста

HunyuanImage 3.0 — это модель для создания изображений по текстовому описанию. Она была выпущена 28 сентября 2025 года и быстро заняла лидирующие позиции в рейтингах.

Главная особенность модели — способность к «рассуждению о мире» (world knowledge reasoning). Если попросить её нарисовать пошаговую инструкцию по приготовлению блюда, она не просто создаст красивую картинку, а покажет логическую последовательность действий: замешивание теста, добавление начинки, формовку. Это стало возможным благодаря мультимодальной языковой модели, обученной на 5 миллиардах пар «изображение-текст» и 6 триллионах текстовых токенов.

Модель поддерживает генерацию читаемого текста внутри изображений — то, с чем многие другие нейросети справляются плохо. Можно создавать плакаты, инфографику, баннеры с чёткими надписями, не прибегая к доработке в графических редакторах.

HunyuanImage 3.0 понимает длинные промпты (более 1000 символов) и работает с запросами на китайском и английском языках. Доступен широкий спектр художественных стилей: от фотореализма до мультипликации и 3D-рендеринга.

Архитектура HunyuanImage 3.0: 80 миллиардов параметров и 64 эксперта

В основе HunyuanImage 3.0 лежит автогрессивный фреймворк с Mixture-of-Experts. Общее количество параметров достигает 80 миллиардов, но во время работы активируется только 13 миллиардов. Это достигается за счёт 64 «экспертов», каждый из которых специализируется на определённых задачах.

Такая архитектура даёт тройное преимущество:

  • Высокая скорость генерации — модель работает примерно в три раза быстрее аналогов сопоставимого качества.
  • Эффективное использование ресурсов — не нужно задействовать все параметры для каждого запроса.
  • Масштабируемость — можно добавлять новых экспертов без перестройки всей системы.

Для оптимизации используются технологии FlashAttention (ускорение механизма внимания), FlashInfer (быстрый инференс) и поддержка VLLM (масштабирование). Модель также поддерживает Chain-of-Thought рассуждения — она может «обдумывать» промпт пошагово, анализируя композицию перед генерацией.

Hunyuan3D 3.0: создание трёхмерных моделей из текста и изображений

Hunyuan3D 3.0 — это модель для генерации трёхмерных объектов. Она может создавать 3D-модели как по текстовому описанию, так и на основе загруженного изображения или эскиза.

Основные возможности:

  • Генерация за 2 минуты — оптимизированный инференс позволяет получать результат быстрее, чем при традиционном моделировании.
  • Чистая топология — модели имеют квад-доминантную сетку, подходящую для игр и 3D-печати.
  • PBR-текстуры — автоматически создаются карты альбедо, нормалей и шероховатости.
  • Поддержка форматов — экспорт в GLB, OBJ, FBX, STL и USDZ.

Модель востребована в геймдеве, архитектуре, дизайне продуктов и для создания контента в метавселенных. По отзывам пользователей, она позволяет ускорить создание ассетов в 5–10 раз по сравнению с ручной работой.

Языковая модель Hy3 Preview: 295 миллиардов параметров и 256K контекст

Hy3 Preview — это языковая модель семейства Hunyuan 3.0, открытая в апреле 2026 года. Она использует MoE-архитектуру с 295 миллиардами параметров, из которых активируется 21 миллиард на каждый проход. Модель поддерживает контекст до 256 тысяч токенов.

Архитектура включает 80 слоёв, 64 головы внимания (с групповым запросом внимания, 8 KV), скрытую размерность 4096 и промежуточную размерность 13312. Используется 192 эксперта с активацией top-8.

По бенчмаркам Hy3 Preview показывает результаты, сопоставимые или превосходящие DeepSeek-V3 и GLM-4.5, при этом активируя значительно меньше параметров. На тестах MATH модель набрала 76.28, на GSM8K — 95.37, на LiveCodeBench-v6 — 34.86. В многозадачных тестах (MMMLU) результат составил 80.15.

Модель поддерживает три режима рассуждения: no_think (прямой ответ), low (лёгкое рассуждение) и high (глубокое цепное рассуждение для сложных задач). Режим переключается через API-параметр reasoning_effort.

Условия использования и лицензирование

Модели Hunyuan 3.0 распространяются под лицензией Tencent Hunyuan Community License Agreement. Основные условия:

  • Бесплатное использование для личных, коммерческих, исследовательских и образовательных целей.
  • Открытый исходный код — можно модифицировать и распространять.
  • Разрешено использовать в коммерческих продуктах и предоставлять API-сервисы.

Ограничения:

  • Лицензия не действует на территории ЕС, Великобритании и Южной Кореи.
  • Если продукт имеет более 100 миллионов активных пользователей в месяц, требуется отдельное согласование с Tencent.

Для самостоятельного запуска HunyuanImage 3.0 потребуется система на Linux с NVIDIA GPU, минимум 170 ГБ свободного места и несколько видеокарт с 80 ГБ памяти каждая. Для Hy3 Preview рекомендуется 8 GPU типа H20-3e или с большим объёмом памяти.

Альтернативные способы доступа:

  • Облачные сервисы: Replicate ($0.08 за изображение), Fal.ai ($0.10 за мегапиксель).
  • Бесплатные платформы: Overchat AI (5 изображений в день).
  • API через различных провайдеров по цене от $0.03 до $0.10 за изображение.
  • Hy3 Preview доступен через Tencent Cloud и OpenRouter по цене примерно в десять раз ниже, чем у GPT-4.

Практические примеры использования

Генерация изображений для маркетинга. Дизайнер может создать баннер для мероприятия, указав в промпте слоган, цветовую гамму и стиль. HunyuanImage 3.0 корректно разместит текст и сгенерирует фон, соответствующий бренду.

Создание 3D-ассетов для игр. Разработчик загружает эскиз персонажа и получает текстурированную 3D-модель за пару минут. Это ускоряет прототипирование и позволяет быстро тестировать разные дизайны.

Обработка длинных технических заданий. Архитектор описывает проект в одном промпте длиной более 1000 символов, и модель генерирует изображение, учитывающее все детали: освещение, материалы, окружение.

Интеграция в чат-боты. Hy3 Preview используется в продуктах Tencent: Yuanbao (AI-ассистент), CodeBuddy (помощник программиста), WorkBuddy (офисный ассистент). Модель обеспечивает естественное общение и решение сложных задач.

Образовательные материалы. HunyuanImage 3.0 может создавать пошаговые инструкции с визуализацией процессов — например, для обучения кулинарии или сборке устройств.

Бенчмарки и сравнение с конкурентами

HunyuanImage 3.0 за неделю после выхода заняла первое место в рейтинге LMArena, обойдя Google Nano Banana. Это говорит о высоком качестве генерации и соответствии ожиданиям пользователей.

Hy3 Preview на предобученных бенчмарках показывает следующие результаты (в сравнении с DeepSeek-V3 и GLM-4.5):

  • MMLU (5-shot): 87.42 (DeepSeek-V3: 87.68, GLM-4.5: 87.73)
  • MMLU-Pro (5-shot): 65.76 (DeepSeek-V3: 63.98, GLM-4.5: 63.67)
  • SuperGPQA (5-shot): 51.60 (DeepSeek-V3: 46.17, GLM-4.5: 49.64)
  • MATH (4-shot): 76.28 (DeepSeek-V3: 59.37, GLM-4.5: 61.00)
  • GSM8K (4-shot): 95.37 (DeepSeek-V3: 88.15, GLM-4.5: 90.06)
  • LiveCodeBench-v6: 34.86 (DeepSeek-V3: 29.31, GLM-4.5: 27.43)
  • MMMLU (5-shot): 80.15 (DeepSeek-V3: 79.54, GLM-4.5: 79.26)
  • INCLUDE (5-shot): 78.64 (DeepSeek-V3: 77.86, GLM-4.5: 76.27)

На тестах для instruct-моделей Hy3 Preview набрала 74.4 на SWE-bench Verified и 54.4 на Terminal-Bench 2.0, что сопоставимо с лучшими моделями OpenAI.

Ключевое преимущество — при меньшем количестве активируемых параметров (21B против 37B у DeepSeek-V3) модель показывает конкурентоспособные или лучшие результаты, особенно в математике и коде.

Ограничения и известные проблемы

Несмотря на впечатляющие возможности, у Hunyuan 3.0 есть ряд ограничений, которые стоит учитывать.

Для HunyuanImage 3.0:

  • Высокие требования к оборудованию для локального запуска (170 ГБ диска, несколько видеокарт с 80 ГБ памяти).
  • Иногда модель некорректно определяет размер объектов на изображении.
  • Отсутствие официальной поддержки русского языка — промпты нужно писать на английском или китайском.

Для Hy3 Preview:

  • Слабое восстановление после ошибок при вызовах инструментов.
  • Чувствительность к гиперпараметрам инференса — требуется тонкая настройка для стабильной работы.
  • Ограниченная доступность из-за лицензионных ограничений в некоторых регионах.

Для Hunyuan3D 3.0:

  • Качество генерации зависит от сложности запроса — простые объекты получаются лучше сложных сцен.
  • Для получения оптимального результата может потребоваться несколько итераций.

Tencent признаёт эти ограничения и планирует улучшать модели на основе обратной связи от сообщества. Компания намерена масштабировать предобучение и RL, а также усиливать интеграцию с продуктовыми командами.

Вопросы и ответы

Можно ли использовать Hunyuan 3.0 бесплатно?

Да, модели Hunyuan 3.0 распространяются под открытой лицензией. Их можно скачать с GitHub или Hugging Face и запустить локально (при наличии мощного оборудования). Также существуют бесплатные платформы, например Overchat AI, предоставляющие 5 изображений в день. Для коммерческого использования через API стоимость составляет от $0.03 до $0.10 за изображение, что значительно дешевле многих аналогов.

Какие языки поддерживает HunyuanImage 3.0?

Модель официально поддерживает китайский и английский языки. Она понимает культурные контексты и нюансы каждого языка. Русский язык напрямую не поддерживается, но модель может корректно обрабатывать транслитерацию и базовые русские слова, если они включены в английский текст промпта.

Чем Hunyuan 3.0 отличается от Midjourney и DALL-E?

Главные отличия: открытый исходный код (можно запустить локально и модифицировать), архитектура Mixture-of-Experts (высокая скорость при меньших затратах), способность к рассуждению о мире (генерация логических последовательностей), качественная работа с текстом внутри изображений и более низкая стоимость (от $0.03 за изображение против $10 в месяц за базовый план Midjourney).

Какие форматы 3D-моделей поддерживает Hunyuan3D 3.0?

Модель поддерживает экспорт в форматы GLB, OBJ, FBX, STL и USDZ. Это покрывает большинство популярных 3D-редакторов (Blender, Unity, Unreal Engine), игровых движков и slicer-программ для 3D-печати. Модели имеют квад-доминантную топологию и автоматически сгенерированные PBR-текстуры.

Какие системные требования для запуска Hy3 Preview?

Для запуска Hy3 Preview рекомендуется 8 GPU типа NVIDIA H20-3e или с большим объёмом памяти. Модель можно развернуть с помощью фреймворков vLLM или SGLang. Для тех, у кого нет мощного оборудования, доступны облачные сервисы Tencent Cloud и OpenRouter по цене примерно в десять раз ниже, чем у GPT-4.

Можно ли коммерчески использовать модели, созданные с помощью Hunyuan 3.0?

Да, лицензия Tencent Hunyuan Community License Agreement разрешает коммерческое использование, включая создание коммерческих продуктов и предоставление API-сервисов. Однако есть ограничения: лицензия не действует в ЕС, Великобритании и Южной Корее, а для продуктов с более чем 100 миллионами активных пользователей в месяц требуется отдельное согласование с Tencent.

Какие задачи лучше всего решает Hunyuan 3.0?

Hunyuan 3.0 особенно эффективен для: генерации изображений с читаемым текстом (баннеры, инфографика), создания 3D-ассетов для игр и печати, обработки длинных и сложных промптов (технические задания, сценарии), решения математических и логических задач (языковая модель), а также для интеграции в продукты (чат-боты, ассистенты, инструменты для разработчиков).