← WRÓĆ DO MAPY SYSTEMU

SYSTEM 07

WHISPER AI ASSISTANT

MOWA W CZASIE RZECZYWISTYM / TŁUMACZENIE / LOKALNE AI

Desktopowy asystent AI do transkrypcji mowy w czasie rzeczywistym, tłumaczenia EN-PL i odpowiedzi wspieranych przez lokalne AI.

PYTHONWHISPERCTRANSLATE2HUGGING FACELOKALNY LLMROZPOZNAWANIE MOWYWINDOWS

TOŻSAMOŚĆ SYSTEMU

ID SYSTEMUWHISPER-AI-07

STATUSDZIAŁAJĄCY PROTOTYP

TYPMOWA / TŁUMACZENIE / LOKALNE AI

Desktopowy pipeline mowy w czasie rzeczywistym łączący transkrypcję, tłumaczenie, trasowanie pytań i lokalny model językowy.

01 / PRZEGLĄD

PRZEGLĄD PROJEKTU

System przechwytuje mowę z mikrofonu lub audio systemowego i zamienia ją w ustrukturyzowany kontekst tekstowy niemal w czasie rzeczywistym.

Główny lokalny przepływ wygląda następująco: AUDIO do TRANSKRYPCJI, dalej PRZETWARZANIE JĘZYKA, ROUTING PYTANIA i LOKALNE AI.

Przegląd systemu

  1. AUDIO
  2. TRANSCRIPTION
  3. PRZETWARZANIE JĘZYKA
  4. TRASOWANIE PYTAŃ
  5. LOKALNE AI

02 / PRZYPADKI UŻYCIA

PRZYPADKI UŻYCIA ASYSTENTA

UC-01

TRANSKRYPCJA MIKROFONU NA ŻYWO

Przechwytuj audio z mikrofonu i zamieniaj mowę na segmenty transkrypcji niemal w czasie rzeczywistym.

UC-02

WEJŚCIE AUDIO SYSTEMOWEGO

Przeprowadź audio loopback desktopu przez ten sam lokalny pipeline mowy.

UC-03

TŁUMACZENIE EN / PL

Przetwarzaj mowę w procesie tłumaczenia z angielskiego na polski i z polskiego na angielski.

UC-04

WYKRYWANIE PYTAŃ

Wykrywaj kompletne pytania wypowiedziane na głos przed złożeniem kontekstu dla asystenta.

UC-05

STRUMIEŃ LOKALNEJ ODPOWIEDZI

Wyślij pytanie i kontekst do lokalnego modelu Qwen z odpowiedzią generowaną na bieżąco i możliwością jej przerwania.

03 / WEJŚCIE AUDIO

WEJŚCIE AUDIO

Asystent może przyjmować dwa lokalne źródła i przechowywać je w krótkich segmentach z oznaczeniem czasu przed transkrypcją.

Mapa sygnału mowy

SEG-01

MIKROFON

lokalny kanał przechwytywania

SEG-02

AUDIO SYSTEMOWE / LOOPBACK

kanał audio desktopu

MACIERZ WEJŚĆ AUDIO
BUFOR AUDIOT-01 / T-02
PRZETWARZANIE MOWYPRZEPŁYW GŁOSU

Łańcuch wejściowy

  1. MIKROFON
  2. AUDIO SYSTEMOWE / LOOPBACK
  3. BUFOR AUDIO
  4. PRZETWARZANIE MOWY

04 / PIPELINE MOWY

PIPELINE MOWY

Przepływ mowy zaczyna się od segmentacji lokalnego audio, następnie każdy segment przechodzi przez Whisper i daje wynik transkrypcji.

Przetwarzanie mowy

  1. WEJŚCIE AUDIO
  2. BUFOR / SEGMENT
  3. WHISPER
  1. TRANSCRIPT
  2. ROUTING JĘZYKOWY

Rozgałęzienie transkrypcji

ŚCIEŻKA TŁUMACZENIA

Tłumaczenie EN - PL może działać przez lokalny potok CTranslate2 z wykorzystaniem modeli Hugging Face.

Dostępny jest również osobny ręczny przepływ tłumaczenia.

ŚCIEŻKA PYTANIA

Transkrypcja może być także skierowana bezpośrednio do analizy pytania i przepływu asystenta.

Ta gałąź przygotowuje kontekst do komponowania odpowiedzi i przekazania go lokalnemu modelowi.

TŁUMACZENIE JEST OPCJONALNE W PIPELINE

05 / INTERFEJS

INTERFEJS WHISPER AI ASSISTANT

Desktopowa przestrzeń pracy na żywo łącząca angielską transkrypcję, polskie tłumaczenie i rozmowę wspieraną przez lokalne AI w jednym interfejsie.

06 / TRASOWANIE PYTAŃ

TRASOWANIE PYTAŃ

Wykrywanie pytań jest traktowane jako krok trasowania przed wywołaniem lokalnego modelu.

Łańcuch trasowania pytań

  1. TRANSCRIPT
  2. ANALIZA PYTANIA
  3. PYTANIE KOMPLETNE
  4. SKŁADANIE KONTEKSTU
  5. LOKALNY LLM
  1. WYKRYTO PYTANIE

    System oznacza tekst wejściowy jako intencję pytania, gdy warunek trasy zostanie spełniony.

  2. PYTANIE KOMPLETNE

    Przeanalizowane zdanie jest weryfikowane i przygotowywane jako pełny sygnał żądania.

  3. TREŚĆ PYTANIA

    Treść pytania jest wyodrębniana z transkrypcji i przygotowywana do dalszego składania kontekstu.

  • ADRESAT
  • WYMAGANY KONTEKST PROFILU

07 / LOKALNY ASYSTENT AI

LOKALNY ASYSTENT AI

Dla transkrypcji gotowych do obsługi pytania asystent buduje żądanie z pełnego pytania, kontekstu rozmowy i kontekstu użytkownika, a następnie generuje wynik przez lokalny model językowy.

Przepływ lokalnego asystenta

  1. PEŁNE PYTANIE + KONTEKST
  2. LOKALNY LLM QWEN
  3. ODPOWIEDŹ STRUMIENIOWA
  • Preload: kontekst modelu jest przygotowywany przed rozpoczęciem żądania.
  • Kontrola gotowości: sprawdzana jest gotowość środowiska uruchomieniowego i wejścia.
  • Strumieniowe wyjście: tokeny są emitowane przyrostowo.
  • Anulowanie: generowanie może zostać przerwane przez użytkownika.
  • Kontekst rozmowy: wcześniejsze wypowiedzi są przenoszone do nowych promptów.
  • Pytania uzupełniające: prompty mogą bazować na wcześniejszych wymianach.

08 / STACK TECHNOLOGICZNY

STACK TECHNOLOGICZNY

  • Python
  • Whisper
  • CTranslate2
  • Hugging Face Transformers
  • LOKALNY LLM / QWEN
  • ROZPOZNAWANIE MOWY
  • NLP
  • Windows

09 / STATUS

STAN PROJEKTU

ID SYSTEMU WHISPER-AI-07

STANDZIAŁAJĄCY PROTOTYP

ZAKRESSYSTEM MOWY W CZASIE RZECZYWISTYM + LOKALNE AI