категории | RSS

Японский разработчик под ником rS_alonewolf рассказал о необычном проекте: он почти полностью с помощью Qwen3.8 27B собрал систему, которая ищет в длинных видео для взрослых 10-секундные фрагменты с кульминационными моментами и вырезает их для дальнейшего использования в ComfyUI.

Идея появилась из вполне практической проблемы. Просматривать вручную большое количество роликов слишком долго, а если просто показать видео мультимодальной модели и спросить, где находится нужный момент, она пока справляется недостаточно точно.

Скрипт отслеживает сразу несколько слабых признаков и ищет места, где они совпадают. Разработчик заметил, что потенциальные кульминации часто сопровождаются резкими изменениями аудио в диапазоне примерно 100–1500 Гц, всплесками разницы между соседними кадрами и характерными монтажными приёмами. Дальше формируется список таймкодов, из которых автоматически нарезаются десятисекундные фрагменты.

Ключевые сигналы, на которые опирается алгоритм:

характерные изменения звука в диапазоне 100–1500 Гц с последующим резким затуханием

рост межкадровой разницы, то есть резкое увеличение движения в кадре

монтажные маркеры: стоп-кадры, наплывы и прочие переходы, которыми режиссёр обычно акцентирует момент

совпадение нескольких признаков в узком временном окне

На основе этих сигналов Qwen написал скрипт, который отмечает потенциальные моменты и формирует короткие клипы. По словам автора, результат уже оказался достаточно неплохим, хотя система пока регулярно ошибается.

Следующий этап – полностью автоматизировать обработку: привести ролики к 24 кадрам в секунду и нужному количеству кадров, после чего сразу отправлять их в ComfyUI в качестве референсов для генерации видео.

В перспективе разработчик хочет собрать больше данных и обучить лёгкий классификатор, например CatBoost, на примерах "нужных" и обычных моментов. Идея в том, чтобы алгоритм анализировал комбинацию нескольких слабых сигналов и самостоятельно определял границы фрагмента.

Правда, остаётся серьёзная проблема: голос и движения у разных людей сильно отличаются. Поэтому в будущем системе может потребоваться либо отдельная настройка под конкретных моделей, либо механизм, который сможет компенсировать индивидуальные различия.



Источник новости: shazoo.ru

Bot
2026-08-30T17:43:04Z

Здесь находятся
всего 0. За сутки здесь было 0 человек