← WRÓĆ DO MAPY SYSTEMU

SYSTEM 03

PROMPT DIRECTOR

MULTIMODALNA ORKIESTRACJA PROMPTÓW AI

Lokalne narzędzie multimodalne do analizy referencji obrazowych i wideo oraz komponowania strukturyzowanych promptów dla przepływów generatywnego AI.

PYTHONQWEN3-VLHUGGING FACEFFMPEGMULTIMODALNE AILOKALNE AI

TOŻSAMOŚĆ SYSTEMU

ID SYSTEMUPROMPT-DIRECTOR-03

STATUSAKTYWNE R&D

TYPMULTIMODALNE AI / WIZJA / MODELE LOKALNE

Pipeline analizy referencji i składania promptów dla procesów generowania obrazów i wideo.

01 / PRZEGLĄD

PRZEGLĄD PROJEKTU

Przepływy generatywnego AI często korzystają z wielu referencji, z których każda może opisywać inny aspekt oczekiwanego wyniku.

Prompt Director porządkuje ten kontekst od analizy po routing i zamienia go w strukturę promptu przed etapem docelowego generowania.

Przepływ promptu

  1. PROBLEM
  2. ANALYSIS
  3. ROUTING
  4. USTRUKTURYZOWANY PROMPT

02 / PRZYPADKI UŻYCIA

PROCESY PRACY Z REFERENCJAMI

UC-01

ANALIZUJ REFERENCJE OBRAZÓW

Zamieniaj lokalne referencje wizualne w ustrukturyzowane opisy do późniejszego składania promptu.

UC-02

ANALIZUJ REFERENCJE WIDEO

Przygotuj kontekst ruchu i sceny z lokalnego materiału wideo, gdy wymaga tego proces.

UC-03

TRASUJ SZCZEGÓŁY REFERENCJI

Przypisuj osobne referencje do cech takich jak tożsamość, ubiór, akcja lub oświetlenie.

UC-04

SKŁADAJ USTRUKTURYZOWANE PROMPTY

Łącz analizę, przetrasowany kontekst i intencję użytkownika w strukturę promptu gotową do generowania.

03 / WEJŚCIE MULTIMODALNE

WEJŚCIE MULTIMODALNE

Narzędzie obsługuje lokalne referencje obrazowe i wideo jako materiały wejściowe, a opcjonalne grupowanie pozwala budować bogatszy kontekst promptu.

Rodzina wejść

  1. REFERENCJA OBRAZU
  2. REFERENCJA WIDEO
  3. OPCJONALNE WIELE REFERENCJI
REFERENCJA OBRAZU

Pojedynczy obraz lub para obrazów przygotowana lokalnie.

REFERENCJA WIDEO

Lokalne przechwycenie lub plik lokalny jako źródło ruchu.

OPCJONALNE WIELE REFERENCJI

Opcjonalne grupy wejść trasowane niezależnie według docelowej cechy.

04 / PIPELINE ANALIZY

PIPELINE ANALIZY

Źródła wejściowe najpierw przechodzą przez lokalny routing. Strumienie wideo mogą w razie potrzeby zostać przygotowane klatka po klatce przez FFMPEG, a OCR jest używany tylko wtedy, gdy obraz zawiera tekst wzbogacający opis.

Przepływ analizy

  1. OBRAZ / WIDEO
  2. ROUTING WEJŚCIA MEDIÓW
  3. ANALIZA QWEN3-VL
  1. ANALIZA WIZUALNA
  2. USTRUKTURYZOWANY OPIS

Mapa opcjonalnej gałęzi

STRUMIEŃ WIDEO

FFMPEG do ekstrakcji klatek przed użyciem kontekstu wizualnego Qwen3-VL.

STRUMIEŃ OBRAZU

OCR może zostać uruchomiony jako opcjonalny krok po wykryciu tekstu w referencjach wizualnych.

05 / TRASOWANIE REFERENCJI

TRASOWANIE REFERENCJI

Każde źródło jest mapowane na wyniki przydatne podczas późniejszego komponowania promptu.

Topologia trasowania referencji

REFERENCJA A

PORTRAIT

  • TOŻSAMOŚĆ TWARZY

REFERENCJA B

BODY

  • PROPORCJE CIAŁA

REFERENCJA C

WIDEO

  • HAIR
  • WARDROBE
  • ACTION
  • MOTION
  • CAMERA
  • BACKGROUND
  • LIGHTING

06 / SKŁADANIE PROMPTU

SKŁADANIE PROMPTU

Kompozycja łączy strukturyzowaną analizę, wynik routingu i jawnie określoną intencję. Format wyjściowy służy eksperymentom R&D z promptami MiniMax H3 i generowaniem na podstawie referencji.

Mapa składania promptu

  1. ANALYSIS
  2. TRASOWANIE REFERENCJI
  3. INTENCJA UŻYTKOWNIKA
  4. USTRUKTURYZOWANY PROMPT GENEROWANIA
  5. DOCELOWY PROCES GENEROWANIA

07 / STACK TECHNOLOGICZNY

STACK TECHNOLOGICZNY

  • Python
  • Qwen3-VL-8B-Instruct
  • Hugging Face Transformers
  • FFmpeg
  • Multimodal AI
  • Computer Vision
  • OCR
  • Local AI

08 / STATUS

STAN PROJEKTU

ID SYSTEMU PROMPT-DIRECTOR-03

STANAKTYWNE R&D

ZAKRES MULTIMODAL GENERATIVE AI TOOLING