Narzędzie Pliki

Narzędzie do transkrypcji dźwięku i wideo na tekst

Wybierz plik audio lub wideo i utwórz transkrypcję tekstową lokalnie, bez konieczności przesyłania nagrania.

Działa w przeglądarce. Bez przesyłania.

Działa w przeglądarce. Bez przesyłania.

W przypadku długich nagrań lub plików o wysokiej rozdzielczości zaleca się korzystanie z komputera stacjonarnego lub laptopa. Pozostaw tę kartę otwartą; szybkość działania, zużycie pamięci i baterii zależą od Twojego urządzenia.

Przy pierwszym użyciu pobierane jest około 58 MB danych modelu i lokalnego silnika. Twoje nagranie nie jest przesyłane na serwer; przeglądarka może pobrać te dane ponownie po wyczyszczeniu pamięci podręcznej.

Działa w przeglądarce. Bez przesyłania.

O tym narzędziu

Narzędzie do transkrypcji dźwięku i wideo na tekst w prostym wydaniu.

Rozpoznawanie mowy odbywa się lokalnie w przeglądarce z wykorzystaniem wielojęzycznego modelu Whisper Tiny. Przy pierwszym użyciu przeglądarka pobiera z serwisu Hugging Face pliki otwartego modelu o rozmiarze około 43 MB; samo nagranie nie jest nigdy przesyłane ani tam, ani do UsefulVerse. Przeglądarka może zapisać model w pamięci podręcznej do późniejszego wykorzystania, ale dane te można usunąć. Model jest niewielki, dlatego warto sprawdzić poprawność nazw, liczb i interpunkcji. Nie ma sztywnych limitów dotyczących rozmiaru pliku czy czasu trwania nagrania narzucanych przez serwer; ograniczenia praktyczne zależą od urządzenia, przeglądarki, pamięci operacyjnej, obsługiwanych kodeków multimedialnych, stanu baterii oraz dostępnego miejsca na dysku. W przypadku długich nagrań lub nagrań o wysokiej rozdzielczości zdecydowanie zaleca się korzystanie z komputera stacjonarnego lub laptopa. Do jednorazowego pobrania modelu wymagany jest dostęp do Internetu.

Częste pytania

O Narzędzie do transkrypcji dźwięku i wideo na tekst.

Jak przekonwertować plik audio lub wideo na tekst?

Wybierz nagranie lub plik wideo ze ścieżką dźwiękową, wskaż język mówiony (lub wybierz opcję automatycznego wykrywania), a następnie rozpocznij transkrypcję. Proces rozpoznawania mowy odbywa się na Twoim urządzeniu.

Czy moje nagranie jest przesyłane w celu transkrypcji?

Nie. Plik multimedialny jest dekodowany i transkrybowany bezpośrednio w przeglądarce. Przy pierwszym użyciu pobierane jest około 58 MB plików modelu i lokalnego silnika; w przypadku wyczyszczenia pamięci podręcznej przeglądarki pliki te mogą zostać pobrane ponownie.

Jak dokładna jest transkrypcja?

Kompaktowy model wielojęzyczny może błędnie rozpoznać nazwy, liczby lub znaki interpunkcyjne. Przed wykorzystaniem transkrypcji lub jej udostępnieniem warto sprawdzić jej poprawność.