Ресурсы
Продукты
Система распознавания речи Asr — это передовая технология обработки речи, предназначенная специально для многопользовательских конференц-сред. Её основная цель — решить проблему «кто, что и когда сказал», точно идентифицируя и записывая речевое содержание каждого участника совещания, а также чётко отмечая личность и время речи каждого выступающего.

Система распознавания речи Asr в первую очередь обрабатывает наши голоса, будучи способной понимать содержание, произнесённое пользователем. Вы можете подумать, что компьютеру легко напрямую понять, что мы говорим, когда мы обращаемся к нему. Но это не так просто. Это связано с тем, что когда люди говорят, у каждого разные акценты, интонации, и они могут находиться в сложных и шумных звуковых средах. В этом случае для компьютера чётко понять и точно узнать, что вы пытаетесь выразить, является очень сложной задачей.
Система распознавания речи ASR в основном выполняет процесс преобразования звуковых волн в соответствующий текст. Процесс распознавания выглядит следующим образом:
Сначала наши голосовые звуковые волны обрабатываются с помощью обработки аудиосигналов для формирования сигнального графика. Голосовые кадры разбиваются на модули в миллисекундных окнах. Информационные характеристики распознаются для каждого миллисекундного модульного окна.
Второй шаг — распознавание скорости звука. Что такое скорость звука? Это самое короткое и сжатое фонирование, которое человек может произвести при речи, которое невозможно разделить дальше. Таким образом, скорость звука разбивает большие аудиоданные на наименьшие силовые единицы.
На третьем шаге мы объединяем эти скорости звука, чтобы в конечном итоге сформировать наши текстовые слова или символы.
Распознавание нескольких говорящих: На совещаниях часто говорят одновременно несколько человек. Системе распознавания речи Asr необходимо точно различать речь разных выступающих и связывать её с правильной идентичностью, что включает моделирование голосовых характеристик и подтверждение личности.
Обработка перекрывающейся речи: Часто на совещаниях несколько человек говорят одновременно, что приводит к перекрытию голосовых сигналов. Система должна обладать технологией разделения голоса, чтобы изолировать перекрывающиеся голоса в отдельные сигналы для распознавания и транскрипции.
Неизвестное количество говорящих: Количество участников совещания обычно неопределённо. Системе распознавания речи Asr необходимо динамически адаптироваться к изменяющемуся числу выступающих без потери точности.
Дальний захват голоса: В конференц-залах, если микрофон находится далеко от говорящего, качество голосового сигнала ухудшается. Системе распознавания речи Asr необходима технология дальнего захвата голоса для улучшения качества сигнала и повышения точности распознавания.
Шум и реверберация: В конференц-зале могут присутствовать различные шумы и реверберация, такие как фоновый шум и эхо. Системе распознавания речи Asr необходимо противостоять этим помехам для поддержания производительности распознавания речи.
Таким образом, система распознавания речи Asr в основном включает акустическую модель для чёткого понимания речи и языковую модель для точного преобразования понятой речи в текст. Из-за сложностей распознавания речи в сценариях конференций, включая множество говорящих, различные настройки, множество устройств и высокие требования к实时ности, система распознавания речи Asr сталкивается с проблемами. Однако мы имеем все основания полагать, что благодаря постоянному развитию и инновациям система распознавания речи Asr сделает запись совещаний более эффективной и точной.
Gonsin предлагает вам индивидуальные решения для аудио- и видеосистем для конференций.