На прошлой неделе отменил подписку на голосовой ввод. При том, что пользуюсь им регулярно и считаю полезным — хоть к нему и надо привыкнуть. Просто оказалось, что то же самое есть в опенсорсе и работает не хуже. А если в чем-то и хуже — то это сегодня уже не проблема.

Дело даже не в подписке и не в том, что нужна стабильная связь с чьими-то серверами. Распознавание или вставка текста иногда не срабатывает, а причину не найти: код закрыт. Остается только писать в поддержку.

Заменил Aqua Voice на разработку Дмитрия Волова, которую он выложил в опенсорс, — AquaLocal. Механика такая же: зажал горячую клавишу, сказал, отпустил — текст встал в позицию курсора. Только распознавание идет на своей видеокарте, и аудио наружу не уходит. Конечно, есть требования к оборудованию: видеокарта NVIDIA от 4 ГБ.

Где печатаешь, там можно и диктовать — ввод работает в любом окне. Но часть сценариев Дмитрий сделал под себя: по одной горячей клавише надиктованное уходит заметкой в Obsidian, по другой — задачей в таск-менеджер. А мне нужно было свое.

Раньше в чужой код на незнакомом стеке не полез бы. А теперь дорабатываешь его вместе с агентом — и это уже не проблема. Сначала немного переделал интерфейс под свои предпочтения. Потом посерьезнее — сделал распознавание голосовых сообщений, которые шлю своему телеграм-боту.

Дмитрий все продумал, отладил и выдал рабочий инструмент. Делать такое с нуля точно не взялся бы, а подогнать готовое под себя получилось быстро.

Как-то писал, что иногда лучший код — это тот, который не был написан. И это не значит, что кода нет вовсе. Просто он может быть написан кем-то другим.

📄 Статья Дмитрия о разработке AquaLocal
👉 Репозиторий на GitHub

Участвовали когда-нибудь в опенсорсе?

  • 👍 — да, выкладывал свое или дописывал чужое
  • 🔥 — нет, только пользуюсь готовым
  • 🤔 — GitHub? Нет, не слышал