Разговор с голосовым помощником в шумном кафе или на улице часто превращается в повторение одной и той же фразы несколько раз — устройство просто не слышит владельца из-за посторонних звуков. А в наушниках или умных часах, где нет мощного процессора, работа нейросетей упирается в ограниченные ресурсы батареи. Решить обе проблемы взялись разработчики «Яндекса»: они создали нейросеть размером всего 200 КБ (меньше одной фотографии) и дополнили её чипом, который ускоряет вычисления, но потребляет меньше энергии. Как сообщил ТАСС руководитель направления голосовой активации в «Яндексе» Дмитрий Солодуха, технология уже прошла тестирования, а ранее компания представила механизм, позволяющий устройству слышать пользователя даже при громкой музыке или работающем пылесосе.
Основная проблема, которую решают разработчики, — размер нейросетей. Обычно для качественного распознавания голоса требуются модели, которые «весят» десятки мегабайт. В носимых устройствах, где каждый килобайт на счету, такие модели просто не помещаются. Инженеры «Яндекса» уменьшили модель до 200 Кб — это меньше, чем размер средней фотографии на смартфоне.
Второе ограничение — энергопотребление. Активное использование нейросетей быстро разряжает батарею наушников или часов. Решение — внедрение в архитектуру чипа с NPU (нейронный процессор). Он ускоряет вычисления и при этом потребляет меньше энергии, чем центральный процессор. По словам Дмитрия Солодухи, такой подход может использоваться в наушниках, умных часах и других компактных носимых устройствах с ИИ-функциями.
Кроме того, «Яндекс» ранее представил технологию распознавания голосовых команд в шумной среде. Механизм внимания одновременно анализирует два звуковых сигнала, а нейросеть выбирает наиболее чистый для точной обработки речи. Это позволяет устройству слышать пользователя даже при громкой музыке, льющейся воде или работающем пылесосе. В марте представитель компании сообщал ТАСС о финальных тестированиях наушников с «Алисой AI» перед выпуском на рынок.






















