Японский разработчик под ником rS_alonewolf рассказал о необычном проекте: он почти полностью с помощью Qwen3.8 27B собрал систему, которая ищет в длинных видео для взрослых 10-секундные фрагменты с кульминационными моментами и вырезает их для дальнейшего использования в ComfyUI.
Идея появилась из вполне практической проблемы. Просматривать вручную большое количество роликов слишком долго, а если просто показать видео мультимодальной модели и спросить, где находится нужный момент, она пока справляется недостаточно точно.
Скрипт отслеживает сразу несколько слабых признаков и ищет места, где они совпадают. Разработчик заметил, что потенциальные кульминации часто сопровождаются резкими изменениями аудио в диапазоне примерно 100–1500 Гц, всплесками разницы между соседними кадрами и характерными монтажными приёмами. Дальше формируется список таймкодов, из которых автоматически нарезаются десятисекундные фрагменты.
Ключевые сигналы, на которые опирается алгоритм:
характерные изменения звука в диапазоне 100–1500 Гц с последующим резким затуханием
рост межкадровой разницы, то есть резкое увеличение движения в кадре
монтажные маркеры: стоп-кадры, наплывы и прочие переходы, которыми режиссёр обычно акцентирует момент
совпадение нескольких признаков в узком временном окне
На основе этих сигналов Qwen написал скрипт, который отмечает потенциальные моменты и формирует короткие клипы. По словам автора, результат уже оказался достаточно неплохим, хотя система пока регулярно ошибается.
Следующий этап – полностью автоматизировать обработку: привести ролики к 24 кадрам в секунду и нужному количеству кадров, после чего сразу отправлять их в ComfyUI в качестве референсов для генерации видео.
В перспективе разработчик хочет собрать больше данных и обучить лёгкий классификатор, например CatBoost, на примерах "нужных" и обычных моментов. Идея в том, чтобы алгоритм анализировал комбинацию нескольких слабых сигналов и самостоятельно определял границы фрагмента.
Правда, остаётся серьёзная проблема: голос и движения у разных людей сильно отличаются. Поэтому в будущем системе может потребоваться либо отдельная настройка под конкретных моделей, либо механизм, который сможет компенсировать индивидуальные различия.
Источник новости: shazoo.ru

