Продукты
Система автоматического распознавания речи GONSIN подходит для различных сценариев применения, включая протоколы совещаний, записи тренировок, субтитры в реальном времени, расшифровку записей собеседований, записи судебных заседаний в реальном времени и т.д. Система ASR может объединять текст и голосовую запись каждого участника, объединять и создавать протоколы совещаний, а также поддерживает экспорт текста. Система конференц-связи Китай поддерживает аренду облачного сервера и развертывание локального сервера в локальной сети, обучение искусственного интеллекта и непрерывную оптимизацию системы.
Как новая разработка современных конференц-решений, система автоматического распознавания речи (ASR) обеспечивает более интеллектуальное взаимодействие человека с компьютером. Для традиционных конференций общение с помощью звука и видео уже не удовлетворяет современным потребностям. Кроме того, после встречи обработка документов, протоколы собраний и юридические процедуры для определенных пользователей также должны быть представлены в формате Word. Система автоматического распознавания речи Gonsin может обеспечить своевременную, полную и упорядоченную текстовую транскрипцию звука, а также гарантировать, что текст соответствует речи каждого делегата. Транскрибированный текст может отображаться на большом экране, а также в безбумажной конференц-системе Gonsin в реальном времени.
Система ASR подходит для различных сценариев применения, включая протоколы собраний, записи обучения, субтитры в реальном времени, расшифровку записей интервью, записи судебных заседаний в реальном времени и т.д.

Система ASR GONSIN предлагает три решения: Онлайн-решение для распознавания речи и перевода, Легкое локальное решение для развертывания и Локальное решение для кластера конференц-залов.
Онлайн-решение для распознавания речи и перевода
Легкое локальное решение для развертывания
Локальное решение для кластера конференц-залов
Программная система автоматического распознавания речи GONSIN разработана на платформе технологии полного цифрового автоматического распознавания речи GONSIN. Подключая сетевые аудиоданные к серверу ASR и при поддержке прикладного программного обеспечения ASR и GONSIN, она обеспечивает преобразование речи в текст в реальном времени.

Поддержка выбора и подключения серверов распознавания речи в публичном облаке и частном облаке, что позволяет удовлетворить различные способы развертывания серверов. Возможность установки на ПК или сервер распознавания речи, что обеспечивает гибкое применение в различных сценариях.
Поддержка функций управления выключением сервера ASR, подключения сервера ASR к дискуссионной системе, поиска и настройки ролей микрофонов, а также бесшовная интеграция с публичными письмами дискуссионных систем всех серий, управление конференциями, разделение ролей и автоматическая идентификация.
Поддержка управления персоналом и оборудованием, включая поиск оборудования, отображение информации о номерах устройств, IP-адресах и настройку имен участников; поддержка редактирования информации о собрании, включая создание нового названия собрания, определение времени, места и редактирование содержания собрания.
Поддержка одновременного распознавания нескольких ролей микрофонов и функция защиты от перекрестных помех, что позволяет эффективно избежать взаимных помех при одновременном распознавании нескольких микрофонов; поддержка индикации состояния микрофона, позволяющая отображать включение и выключение микрофона в реальном времени.
Поддержка функции обучения языковой модели. Поддерживается импорт распространенных слов, таких как имена людей и названия мест, для обучения языковой модели.
Поддержка автоматического определения ролей участников, автоматического распознавания речи участников и транскрипции в текст. Программа поддерживает перевод на другие требуемые языки (функции программы варьируются в зависимости от возможностей движка).
Поддержка интеллектуального понимания семантики, которая может автоматически понимать смысл высказываний участников и автоматически разбивать на предложения и абзацы в соответствии с семантикой. Поддержка автоматического преобразования последовательных чисел в арабский формат, а также автоматическое распознавание номеров телефонов, ID-карт и других последовательных чисел с преобразованием в арабский формат.
Поддержка функций редактирования и коррекции текста собрания. Создание отдельных файлов записи для разных ролей или объединение текстовых записей и аудиозаписей каждой роли. Голосовые и текстовые записи могут синхронно воспроизводиться и отображаться для коррекции документа.
Поддержка функции вывода протокола собрания. Поддержка объединения текста, создания протокола собрания и экспорта текста.
Поддержка функции поиска по содержанию, поддержка поиска по тексту. Можно искать ключевые слова, быстро находить соответствующее содержимое, что значительно повышает эффективность поиска информации.
Поддержка функции раздельного вывода текста на экран. При установке на ПК можно реализовать отображение распознанного текста в реальном времени на основном экране рабочего компьютера; поддерживается расширенный раздельный вывод, отображение текстового содержимого распознанной речи в реальном времени. Поддержка настройки экрана, адаптация разрешения экрана, настройка шрифта и размера текста для обеспечения качественного обслуживания раздельного отображения текста.
Поддержка распознавания аудиофайлов: импорт аудиофайла позволяет автоматически преобразовать его содержимое в текст; поддержка форматов файлов mp3, wav и других.
Поддержка выбора устройства ввода звука: можно подключить аудиоустройства ввода компьютера для преобразования аудиовхода в текст в реальном времени.
Поддержка распознавания компьютером текущего воспроизводимого звука и автоматического преобразования его в текст.
Поддержка дополнительных настраиваемых функций: программа поддерживает переключение между китайским и английским языками, а также другими пользовательскими языками; поддерживает вторичную разработку, возможность открыть интерфейсный протокол или выполнить пользовательскую разработку в соответствии с требованиями проекта.
| Система | Операционная система Win7 / win8 / win10, 32/64 бит |
| CPU | I7 и выше |
| Емкость жесткого диска | 500 ГБ и выше |
| Объем памяти | 16 ГБ и выше |
| Видеокарта | Дискретная видеокарта с поддержкой интерфейсов VGA / HDMI / DVI и раздельного вывода на экран |
| Интерфейсы ПК | 1 интерфейс RS-232 и 2 интерфейса RJ45 |
| Разрешение | Автоматическая адаптация |
| Связь с ПК | Ethernet/RS-232 |
Хорошая совместимость системы, поддержка отображения субтитров на устройствах Windows и Android.
Поддержка нескольких режимов отображения субтитров. Поддержка полноэкранного режима и всплывающего режима.
Полноэкранный режим: отображение транскрипции в полноэкранном режиме в виде диалогового окна. Поддержка настройки фона и шрифта.
Режим «Бегущая строка»: отображение транскрипции в стиле плавающей строки. Поддержка настройки строк и шрифта.
Поддержка функции наложения субтитров на видео: поддержка отображения субтитров в реальном времени, наложенных на видеоизображение, интеграция с видеоконференциями и приложениями для отслеживания камер.
Поддержка функции наложения субтитров на безбумажные системы: обеспечение наложения субтитров в реальном времени на безбумажные экраны, интеграция с безбумажными системами, отображение транскрипции в реальном времени на безбумажных терминалах.
С программным обеспечением интеллектуального распознавания речи обеспечивает управление доступом через веб
Поддерживает автоматическое распознавание ролей участников, автоматическое распознавание голоса участника и транскрипцию в текст
Со встроенным движком ASR, использует передовые технологии онлайн-распознавания речи, развертывается через облако для предоставления услуг распознавания речи для локальной речи. Низкая задержка, высокая точность распознавания, точность может достигать более 99%
Сервер распознавания речи может выполнять транскрипцию речи по разным каналам:
GX-AS201: поддерживает 1-канальное распознавание речи
GX-AS202: поддерживает 2-канальное распознавание речи
GX-AS205: поддерживает 5-канальное распознавание речи
GX-AS208: поддерживает 8-канальное распознавание речи
Поддерживает распознавание на заказных языках, таких как китайский, английский, испанский, арабский, русский и французский.
Поддерживает распознавание в множестве сценариев применения: образование, юриспруденция, медицина, конференц-речь, новостные медиа, развлекательное видео, умный дом, социальные сети, автомобильная сфера и т.д.
Поддерживает совместное использование сервера несколькими конференц-залами. Поддерживает объединение нескольких конференц-залов в конференц-центре в локальную сеть и централизованное развертывание сервера для обеспечения параллельного распознавания речи и транскрипции в нескольких конференц-залах.
С программным обеспечением для отображения субтитров с интеллектуальным распознаванием речи предоставляет услуги отображения субтитров для конференций.
| Модель | GX-AS201 | GX-AS202 | GX-AS205 | GX-AS208 |
| Версия системы | Centos7.4+ | |||
| ЦП | i3 | i7 | ||
| Объем памяти | 16 ГБ | 32 ГБ | ||
| Жесткий диск | 256 ГБ SSD | 500 ГБ SSD | ||
| Интерфейсы передней панели | 4×USB2.0 Type-A, 1×3.5 мм линейный выход, 1×3.5 мм микрофонный вход, 1×кнопка питания, 1×индикатор питания | |||
| Интерфейсы задней панели | 4×USB3.0 Type-A, 1×RJ45 10/100/1000M, 1×HDMI 1.4 выход, 1×COM выход, 1×3.5 мм линейный выход, 1×3.5 мм микрофонный вход, 1×антенна WIFI/BT | |||
| Вход питания | 19 В DC | |||
| Рабочая температура | -5°C~45°C | |||
| Температура хранения | -20°C~60°C | |||
| Габариты | 210(Д)×210(Ш)×56(В) мм | |||
Сервер стандартного монтажа в стойку 2U с стабильной и надежной производительностью, использующий оцинкованную сталь SGCC, экологически чистую внешнюю краску, устойчивость к отпечаткам пальцев и устойчивость к контактным сильным магнитным помехам 4 кВ.
Использует высокопроизводительный сервер LINNUX с установленным программным обеспечением ASR Engine V3.0 для автоматического определения ролей участников, автоматического распознавания голосов участников и преобразования их в текст.
Поддерживает совместное использование сервера несколькими конференц-залами. Поддерживает объединение нескольких конференц-залов в конференц-центре в локальную сеть (LAN) и централизованное развертывание сервера для удовлетворения потребностей нескольких конференц-залов в параллельном распознавании речи и транскрипции.
Совместная работа с программным обеспечением для отображения субтитров с интеллектуальным распознаванием речи для обеспечения отображения субтитров на совещаниях.
Высокоэффективная модель CTC, благодаря опциональной авторизации, один сервер поддерживает до 50 одновременных распознаваний.
Сервер использует механизм шифрования SSL для эффективного обеспечения безопасности хранения и передачи конфиденциальной информации. Используются алгоритмы шифрования RC4, MD5 и RSA для обеспечения безопасности данных платформы и предотвращения утечки важной информации.
Встроенное программное обеспечение управления питанием. Оно позволяет контролировать состояние напряжения, чтобы избежать отказа оборудования, вызванного колебаниями напряжения, и обеспечить круглосуточную защиту.
Использует передовые технологии распознавания речи в реальном времени, развернутые через облако для предоставления услуг распознавания речи для локального звука. Низкая задержка, высокая точность распознавания, уровень точности может достигать более 99%.
Двигатель использует модель оплаты пакетов, что эффективно снижает затраты на внедрение и порог начала работы с распознаванием речи. Пользователи могут приобрести пакет программ подходящей длины в зависимости от фактических потребностей в длительности распознавания речи (пожалуйста, своевременно приобретайте пакет услуг для обеспечения нормальной работы двигателя).
Поддерживает распознавание с разделением ролей: можно выбирать разные исходные языки и языки перевода в зависимости от разных ролей, что позволяет одновременно распознавать несколько языков, транскрибировать их в соответствующий текст и переводить.
Поддерживает несколько основных языков, таких как китайский, английский, французский, русский, арабский и испанский.
Имеет программное обеспечение для отображения субтитров с интеллектуальным распознаванием речи, которое может отображать исходный текст и переведенный текст одновременно, или устанавливать отображение только исходного/переведенного текста, предоставляя услуги субтитров для деловых переговоров и видеоконференций на разных языках.
Использует технологию модели интеллектуального распознавания языка, основанную на технологии AI для реализации распознавания речи.
Поддерживает настраиваемое распознавание языков, таких как китайский, английский, испанский, арабский, русский и французский.
Поддерживает распознавание в нескольких сценариях применения: образование, судебная система, медицина, выступления на конференциях, новостные и медиа-материалы, развлекательное видео, умный дом, социальная сфера, автомобильная промышленность и так далее.
Любое программное обеспечение для автоматического распознавания речи, независимо от его сложности, может извлекать и разлагать ваши слова для анализа и ответа, и его основная последовательность событий перечислена ниже:
1.Говорите с программным обеспечением через аудиовход.
2.Автоматическое распознавание речи, с которым вы говорите, создаст WAV-файл ваших слов.
3.Файлы формы сигнала были очищены путем удаления фонового шума и нормализации громкости.
4.Отфильтрованные формы сигнала разлагаются на так называемые фонемы. (Фонемы — это основные компоненты языка и произношения слов. В английском языке их 44, они состоят из голосовых блоков, таких как "wh", "th", "ka" и "t").
5.Каждая фонема действует как цепочка, начиная с первой фонемы и анализируя их последовательно, и распознаватель речи ASR использует статистический вероятностный анализ для вывода целого слова, а затем вывода полных предложений.
6.Ваше программное обеспечение ASR для автоматического распознавания речи, которое теперь "понимает" ваши слова, может ответить вам осмысленно.
Любое программное обеспечение для автоматического распознавания речи, независимо от его сложности, может извлекать и разлагать ваши слова для анализа и ответа, и его основная последовательность событий перечислена ниже:
1.Говорите с программным обеспечением через аудиовход.
2.Автоматическое распознавание речи, с которым вы говорите, создаст WAV-файл ваших слов.
3.Файлы формы сигнала были очищены путем удаления фонового шума и нормализации громкости.
4.Отфильтрованные формы сигнала разлагаются на так называемые фонемы. (Фонемы — это основные компоненты языка и произношения слов. В английском языке их 44, они состоят из голосовых блоков, таких как "wh", "th", "ka" и "t").
5.Каждая фонема действует как цепочка, начиная с первой фонемы и анализируя их последовательно, и распознаватель речи ASR использует статистический вероятностный анализ для вывода целого слова, а затем вывода полных предложений.
6.Ваше программное обеспечение ASR для автоматического распознавания речи, которое теперь "понимает" ваши слова, может ответить вам осмысленно.
Gonsin предлагает вам индивидуальные решения для аудио- и видеосистем для конференций.