ч.2 (концовка) - Оффлайн Реалтайм (15сек) EN-to-RU синхроперевод : Whisper берёт реванш
Начало: https://youtu.be/8krPC_6m1P8 Создаём самодельный нейросетевой оффлайновый синхронный реалтайм (задержка 10-15 сек) переводчик с английского на русский, работающий локально на видеокарте NVIDIA P106-100 (это аналог видеокарты NVIDIA GeForce GTX 1060) с 6 гигабайтами видеопамяти. Для real-time распознавания аудио речи в текст используется нейросетевая модель Faster- Whisper-Distill-Medium-En через инструмент Faster-Whisper с исходным кодом Whisper-Live на языке Python, который был доработан (в файле faster_whisper_backend.py вставлена 91-ая строка self.compute_type = "int8", а файл client.py показан на видео). Для быстрого перевода распознанного текста с английского языка на русский используется LLM модель Gemma-3-4b-it-q4_k_m.gguf, запускаемая через llama-server из Llama.CPP Для real-time озвучки русского текста используется голос Ivona Maxim через SAPI5. Если вы знаете, какая модель переводит ещё лучше и быстрее, чем Gemma-3-4b-it-q4_k_m то пишите в комментарии. Если вы знаете, есть ли дистилированные модели faster-whisper для других языков кроме английского, так же пишите в комменты. Да и в целом - может уже есть синхропереводчик, работающий на слабом железе, и что вообще ещё можно улучшить и как - пишите в комменты. Использование видеопамяти (VRAM) - около 4.5 гигабайт (включая ОС Win10). Использование RAM - около 6 гигабайт. Использование CPU - незначительное.
Название:
ч.2 (концовка) - Оффлайн Реалтайм (15сек) EN-to-RU синхроперевод : Whisper берёт реванш
Категория:
Разное