Konwerter plików VOX do SPH
Konwertuj swoje pliki w formacie vox do formatu sph przez Internet i bezpłatnie
vox
sph
Jak przekonwertować plik w formacie VOX do formatu SPH
Wybierz pliki z komputera, dysku Google, usługi Dropbox, adresu URL lub po prostu przeciągnij plik na stronę.
Wybierz format sph lub inny potrzebny Ci format (spośród ponad 200 wspieranych formatów).
Poczekaj, aż plik zostanie przekonwertowany do formatu sph; od razu po konwersji możesz go pobrać.
O formatach
VOX to format audio bez naglowka oparty na kodowaniu Dialogic ADPCM, szeroko przyjety w telefonii, systemach interaktywnej odpowiedzi glosowej (IVR) i platformach poczty glosowej od lat 80. Kazda probka audio jest kompresowana do 4 bitow za pomoca algorytmu opracowanego przez Oki Electric i zaimplementowanego sprzetowo na kartach interfejsu telefonicznego firmy Dialogic Corporation. Pliki VOX zwykle uzywaja czestotliwosci probkowania 6000 lub 8000 Hz, tworzac wyjatkowo kompaktowe nagrania zoptymalizowane pod katem zrozumialosci mowy, a nie jakosci muzycznej. Poniewaz format nie zawiera naglowka, oprogramowanie do odtwarzania musi z gory znac czestotliwosc probkowania i parametry kodowania — kompromis, ktory redukuje narzut, ale wymaga starannego zarzadzania plikami. Glowna zaleta VOX jest efektywnosc przechowywania: jednominutowe nagranie glosowe przy 8 kHz zajmuje ok. 240 KB, co jest praktyczne dla systemow przechowujacych tysiace promptow. Dialogic ADPCM jest zgodny ze standardem ITU-T G.726, zapewniajac interoperacyjnosc sprzetu telefonicznego róznych producentow. Nawet gdy nowoczesne centra obslugi migruja na systemy IP z kodekami takimi jak Opus), ogromne biblioteki nagran VOX przetrwaly w starszych wdrozeniach IVR i archiwach zgodnosci regulacyjnej na calym swiecie.
SPH to rozszerzenie plikow audio przechowywanych w formacie NIST SPHERE (SPeech HEader REsources) — standardzie stworzonym przez amerykanski National Institute of Standards and Technology okolo 1990 roku. Przeznaczony do badan nad mowa, pliki SPH zawieraja 1024-bajtowy naglowek ASCII wypelniony metadanymi — identyfikatorami bazy danych, liczba kanalow, czestotliwoscia probkowania, kolejnoscia bajtow i typem kompresji — co czyni kazde nagranie samoopisujoacy sie. Dane audio to zwykle 16-bitowe liniowe PCM probkowane przy 16 kHz, choc dozwolone sa inne konfiguracje. Badacze z NIST, DARPA i uniwersytetow na calym swiecie polegaja na SPH przy dystrybucji korpusow mowy, takich jak TIMIT, Switchboard i kolekcje LDC, ktore stanowia fundament nowoczesnych systemow automatycznego rozpoznawania mowy. Kluczowa zaleta jest to, ze czytelny naglowek pozwala skryptom parsowac metadane nagrania bez dekodowania binarnego. Scisla standaryzacja formatu eliminuje tez niejednoznacznosc przy wspoldzieleniu zbiorow danych miedzy instytucjami i platformami. Poniewaz pliki SPH przechowuja nieskompresowane PCM, zachowuja pelna wiernosc audio — co jest krytyczne przy trenowaniu modeli akustycznych, gdzie nawet drobne artefakty moga znieksztalcic wyniki.