Technologie
Jak echo99 funguje
Nativní záznam zvuku v macOS, otevřené modely pro zpracování řeči a veškerá AI běžící přímo na vašem Macu. Zde jsou technické podrobnosti.
Nativní záznam — bez virtuálního audio ovladače
echo99 je nativní aplikace pro řádek nabídek napsaná ve Swiftu. Obě strany hovoru nahrává do dvou oddělených stop výhradně pomocí funkcí systému macOS:
- Systémový zvuk — zachycený pomocí Core Audio process taps, rozhraní, které Apple přidal v macOS 14.4. Žádný BlackHole, žádný Loopback, žádné rozšíření jádra, žádné virtuální výstupní zařízení, přes které by se musel váš zvuk přesměrovávat.
- Mikrofon — zachycený pomocí AVAudioEngine, standardního zvukového enginu macOS, s automatickým zotavením při přepnutí zařízení během hovoru.
Stopy se zapisují jako standardní soubory WAV a záměrně zůstávají oddělené: zvuk z mikrofonu je vždy „Me“ a systémová stopa nese všechny ostatní — základ pro přesné označování mluvčích. Více podrobností v článku jak funguje záznam systémového zvuku.
Modely převodu řeči na text
Přepis využívá otevřenou rodinu modelů Parakeet od NVIDIA, převedenou do Core ML, takže běží výhradně na vašem Macu. Model si vyberete v okně Config aplikace:
- Parakeet TDT v3 (0,6 mld. parametrů) — výchozí: vícejazyčný přepis s časovými značkami na úrovni slov.
- Parakeet TDT v2 (0,6 mld. parametrů) — alternativa jen pro angličtinu.
- Parakeet Unified — anglický streamovací model, dostupný jako volitelné stažení.
- Parakeet CTC 110M — volitelný doplňkový model, který pohání funkci vlastního slovníku a posiluje jména a odborné výrazy, jež echo99 řeknete, aby očekávalo.
Označování mluvčích
Rozlišení mluvčích — rozeznání ostatních hlasů — běží pouze na systémové stopě a probíhá také na zařízení:
- Online diarizér (výchozí) — kombinuje segmentaci pyannote s hlasovými reprezentacemi WeSpeaker a označuje mluvčí průběžně během zpracování zvuku.
- Offline diarizér (volitelné stažení) — využívá globální shlukování (VBx) a komunitní model pyannote. Zpracuje celou nahrávku najednou a lze mu zadat skutečný počet účastníků hovoru.
Rozpoznávání lidí napříč nahrávkami
Diarizace odděluje hlasy jen v rámci jedné nahrávky. Pojmenovat hlas — a nechat echo99, aby danou osobu příště rozpoznalo — je druhý krok, který také běží na zařízení:
- Hlasový otisk je embedding. Diarizace už každého mluvčího na druhé straně převede na kompaktní číselný embedding — vektor, který zachycuje, jak hlas zní. Když někoho pojmenujete v okně Manage People, echo99 tento embedding uloží jako jeho hlasový otisk do souboru galerie na vašem disku.
- Porovnání je výpočet vzdálenosti. V každé další nahrávce echo99 porovná embedding každého mluvčího s hlasovými otisky ve vaší galerii pomocí kosinové vzdálenosti. Pokud nejbližší z nich spadá do prahu spolehlivosti — změřeného na soukromé testovací sadě a záměrně přísného — označí se mluvčí jménem dané osoby; jinak zůstane „Them-N“.
- Nikdy nehádá a sám se neučí. Nejistá shoda zůstane „Them-N“, aby nehrozilo nesprávné jméno, a automatická shoda nikdy nezapisuje zpět do galerie — ta se rozrůstá jen tehdy, když někoho pojmenujete vy. Rozpoznávání je ve výchozím stavu vypnuté.
Samotné porovnávání je prostý vektorový výpočet a nepotřebuje síť; embeddingy pocházejí ze stejných modelů na zařízení, které provádějí diarizaci. Hlasové otisky jsou biometrická data a zůstávají na vašem Macu — rozpoznávání mluvčích popisuje, co to znamená pro vaše soukromí a kontrolu.
Veškeré zpracování AI na vašem Macu
Každý výše uvedený model běží přes Core ML a na Macu s čipem Apple jej urychluje Apple Neural Engine. Modely se jednou stáhnou z internetu; poté nahrávání, přepis i označování mluvčích fungují s vypnutou Wi-Fi. Váš zvuk se nikdy neposílá na server — žádný přepis na straně serveru vůbec neexistuje.
Modely na zařízení spouští FluidAudio, open-source sada nástrojů pro Swift od Fluid Inference, která zpřístupňuje tyto řečové modely v Core ML.
Vyzkoušejte echo99 na příštím hovoru
Stažení zdarma. Bez účtu. Nahrávání i přepis zůstávají na vašem Macu.
Zdarma · macOS 14.4+ · Notarizováno u společnosti Apple