Zum Artikel springen
PlanToCodeDocsApp herunterladen

HandbuchMitgelieferte Tools

Diktat und Vokabular

Das Desktop-Diktat läuft mit Ihrem eigenen OpenAI- oder Gemini-Schlüssel und Hinweisvokabularen pro Projekt. Telefone transkribieren über die PlanToCode-Dienste. Die Fehlerklassen sagen Ihnen, welche Schicht versagt hat.

Gegen den Quellcode geprüft am 17. September 2026

Auf dieser Seite

Diktat einrichten

Nur das Diktat vom Telefon läuft über den regionalen Server von PlanToCode
Nur das Diktat vom Telefon läuft über den regionalen Server von PlanToCodeDas Desktop-Diktat nimmt in der Desktop-Laufzeit auf und sendet das Audio mit Ihrem API-Schlüssel und Ihrem Vokabular direkt an OpenAI oder Gemini, und das Transkript kommt in den Composer zurück. Über 25.000.000 Bytes lehnt der Desktop vor dem Upload zu OpenAI ab. Das Diktat auf dem Telefon leiht sich zuerst über das Relay den Vokabular-Prompt des Desktops und lädt dann das Audio mit seinem PlanToCode-JWT zum regionalen Server hoch, der es mit OpenAI unter dem Schlüssel von PlanToCode transkribiert und Ihr Guthaben belastet. Der Server nimmt bis zu 100 MiB an, sein OpenAI-Aufruf endet aber bei 25 MiB.
Desktopnimmt in der Laufzeit auf
OpenAI oder Geminigpt-4o-transcribe · gemini-flash-latest
Audio, Ihr API-Schlüssel, Ihr Vokabular
Transkript
über 25.000.000 Bytes: vor dem OpenAI-Upload abgelehnt
Vokabular-Prompt, über das Relay
TelefoniPhone oder Android
Regionaler Server/api/audio/transcriptions
OpenAIopenai/gpt-4o-transcribe
Audio + JWT
Transkript
PlanToCode-Key
Transkript
der Server nimmt bis zu 100 MiB an, sein OpenAI-Aufruf endet aber bei 25 MiB
  • Ihr Schlüsseltranscribe_with_provider

    Der Desktop ruft OpenAI oder Gemini direkt mit dem Schlüssel auf, der unter Settings → API Keys gespeichert ist. Die Server von PlanToCode sehen weder das Audio noch den Schlüssel.

  • PlanToCode-Key/api/audio/transcriptions

    Telefone laden mit ihrem PlanToCode-JWT hoch und verlangen openai/gpt-4o-transcribe. Der Server lehnt den Upload ohne positives Guthaben ab und belastet Ihr Konto mit der Transkription.

  • Geliehenes Vokabularsystem.voiceTranscriptionContext

    Vor dem Upload fragt das Telefon den Desktop über das Relay nach seinem Vokabular-Prompt. Ohne Antwort lädt es ohne Prompt hoch, und der Server baut seinen eigenen Standard-Prompt.

  1. Öffnen Sie Settings → API Keys und speichern Sie einen persönlichen OpenAI- oder Gemini-API-Schlüssel.
  2. Öffnen Sie Settings → Voice, wählen Sie OpenAI oder Gemini als Diktatdienst und speichern Sie.
  3. Erlauben Sie den Mikrofonzugriff, wenn das Betriebssystem danach fragt.

Diktat verwendet Ihren eigenen API-Schlüssel und ist von der ChatGPT-Anmeldung getrennt, die den Agenten ausführt. Die einzigen akzeptierten Modell-IDs sind gpt-4o-transcribe und gemini-flash-latest. Vor der ersten Aufnahme sendet der Desktop eine synthetische Preflight-WAV an den echten Anbieterendpunkt und cacht das Ergebnis pro Anbieter und Modell, nach einem Erfolg 15 Minuten und nach einem Fehler 5 Minuten lang, oder bis Sie die Einstellungen erneut speichern. OpenAI-Anfragen laufen nach 120 Sekunden ab.

Aufnahmen im Review Mode laufen über den regionalen Server mit POST /api/llm/video/analyze zu Gemini. Auf dem iPhone wird die Erzählung zu jedem Screenshot zuerst transkribiert. Die Medienkapitel zu iOS und Android beschreiben den Review Mode genauer.

Bringen Sie der Transkription Ihre Wörter bei

OpenAI lässt Ihrem Vokabular 265 von 1.000 Bytes und kürzt zuerst die Projektliste
OpenAI lässt Ihrem Vokabular 265 von 1.000 Bytes und kürzt zuerst die ProjektlisteDer Transkriptionsprompt für OpenAI ist auf 1.000 Bytes begrenzt, maßstabsgetreu gezeichnet. Die escapten Regeln mit ihren Tags belegen 683 Bytes, ein Zeilenumbruch und die Vokabular-Tags weitere 52, sodass Ihr Vokabulartext die letzten 265 Bytes erhält. Die globale Liste kommt zuerst, also wird die Projektliste gekürzt. Gemini erlaubt 1.000.000 Bytes: In gleicher Breite gezeichnet sind seine vollständigen Regeln mit 1.836 Bytes eine dünne Linie, und der Rest fasst etwa ein Megabyte Vokabular. Ein Telefon nutzt denselben Prompt, wenn der Desktop ihn für OpenAI baut.
OpenAI-Prompt, 1.000 Bytes maßstabsgetreu
Ihr Vokabular, 265 Bytes
Regeln, 683 Bytes
global
Projekt
Rest der Projektliste, abgeschnitten
Gemini-Prompt, 1.000.000 Bytes in gleicher Breite
Platz für etwa ein Megabyte Vokabular
der ganze OpenAI-Prompt wäre hier 0,6 px breit
Ein Telefon nutzt denselben Prompt, wenn der Desktop ihn für OpenAI baut.
  • Regelntranscription_system_prompt

    Die kompakten Regeln für OpenAI belegen nach dem XML-Escaping 622 Bytes und mit ihren Tags 683. Das Budget erlaubt ihnen bis zu 720 Bytes und hält 280 für das Vokabular frei.

  • Ihr Vokabularpersonal_vocabulary_kb

    Nach den Regeln lassen ein Zeilenumbruch und 51 Bytes Tags 265 Bytes Text übrig. Die globale Liste kommt zuerst, dann die Projektliste, beide XML-escapt und an der Grenze abgeschnitten, notfalls mitten im Wort. Die gezeigte Aufteilung ist ein Beispiel.

  • Geminitranscription_prompt_max_bytes

    Gemini erhält die vollständigen Regeln, 1.836 Bytes mit Tags, und Platz für etwa ein Megabyte Vokabular, sodass nichts gekürzt wird, was Sie realistisch eintippen.

Die Spracheinstellungen halten ein globales Vokabular und ein Vokabular pro Projekt. Begriffe, die Sie überall verwenden, gehören in die globale Liste, repository-spezifische Namen in die Projektliste. Sie reisen als XML-escapte Schreibreferenz im Transkriptionsprompt mit der ausdrücklichen Regel, sie nie einzufügen. Bei OpenAI bleiben ihnen nach den Regeln und Tags 265 Bytes Text, die globale Liste zuerst.

Fehlerklassen

Sichtbares ProblemPrüfen
Mikrofon nicht verfügbarDie Betriebssystemberechtigung. Die Bereitschaft verlangt außerdem einen nutzbaren Audioeingang.
Anbieter nicht konfiguriertSettings → API Keys und der gespeicherte Diktatdienst unter Settings → Voice.
Kontingent- oder RatenbegrenzungNur OpenAI, klassifiziert anhand des 429-Codes und nie aus Freitext. Kontingent-Codes wie insufficient_quota, credit_balance_exhausted und die Ausgaben- oder Nutzungslimits verweisen auf die Abrechnung. Jeder andere 429, etwa rate_limit_exceeded oder slow_down, ist ein Ratenlimit, das mit der Zeit vergeht. Ein Gemini-Fehler erscheint als Schlüsselproblem und sperrt das Gemini-Diktat für 5 Minuten oder bis Sie die Einstellungen unter Settings → Voice speichern.
Aufnahme zu großDer Desktop lehnt mehr als 25.000.000 Bytes vor einem OpenAI-Upload ab. Nehmen Sie einen kürzeren Clip auf oder wechseln Sie zu Gemini.