Нейросетевые технологии как реализация программы для изменения голоса в реальном времени - TU

Нейросетевые технологии как реализация программы для изменения голоса в реальном времени

Abstract

В данном исследовании ставится цель разработки нейросети для изменения голоса в реальном времени. Основное внимание уделено вопросам захвата и обработки аудиосигнала, извлечению признаков с помощью методов, таких как MFCC (Mel-frequency cepstrum, Мелочастотные кепстральные коэффициенты), а также разработке и обучению нейросетевой модели на основе LSTM (Long Short-Term Memory, Долгая краткосрочная память) для эффективного изменения характеристик голоса (тембра, высоты, скорости). Методология включает использование методов машинного обучения для создания гибкой и интуитивно понятной системы с минимальной задержкой при обработке сигнала. Оптимизация системы для работы в реальном времени и обеспечение высокого качества измененного звука являются ключевыми задачами исследования. Для достижения поставленных целей планируется провести анализ существующих подходов к обработке аудиосигналов и изменению голоса. Будут рассмотрены различные архитектуры нейронных сетей, включая сверточные и рекуррентные модели, для выбора наиболее подходящего решения. Особое внимание будет уделено сбору и подготовке данных, включая запись и аннотирование аудиофайлов с различными характеристиками голоса. В заключение, планируется провести тестирование системы на реальных данных и оценить её производительность с точки зрения качества звука и скорости обработки.

Keywords

нейросеть, изменение голоса, реальное время, аудиосигнал, машинное обучение, MFCC, тембр, LSTM, оптимизация, рекуррентная нейросеть.

Your browser does not support PDFs. Download it instead.

publication date:2026-07-23
article views:0