Hinweis Diese Website befindet sich im Aufbau. Angaben können unvollständig, veraltet oder fehlerhaft sein. Note This website is still under construction. Information may be incomplete, outdated or incorrect.
Zurück zur ZeitleisteBack to timeline

Masterprojekt — Interactive TechnologiesMaster's project — Interactive Technologies

ARCTA — Automated Radio Communication Transcription & Analysis

LaufendOngoing 2026 — laufendpresent

AufgabeTask

Feuerwehr- und BOS-Sprechfunk wird im Einsatz gesprochen, nicht geschrieben — stark dialektbehaftet, unter Zeitdruck und oft mit gestörter Audioqualität. Die nachträgliche Protokollierung ist entsprechend aufwändig. Ziel von ARCTA ist eine Anwendung, die aus solchen Audioaufnahmen ein normiertes, hochdeutsches und strukturiertes Einsatzprotokoll erzeugt. Fire service and emergency radio traffic is spoken under pressure, not written — heavily dialect-coloured and often with degraded audio quality. Documenting it afterwards is correspondingly laborious. The goal of ARCTA is an application that turns such recordings into a normalised, standard-German, structured incident log.

Hauptziele sind die automatische Transkription des Funkverkehrs (Speech-to-Text) und die Generierung eines strukturierten Funkprotokolls. Als Nebenziele kommen die Erkennung und Klassifikation einzelner Funksprüche, die Identifikation von Rufnamen, Keyword-Spotting sowie die Erkennung von Funkpausen, Unterbrechungen und Doppelbelegungen hinzu. The primary goals are automatic transcription of the radio traffic (speech-to-text) and generation of a structured radio log. Secondary goals include detecting and classifying individual transmissions, identifying call signs, keyword spotting, and detecting radio pauses, interruptions and channel collisions.

VorgehenApproach

Nach der Festlegung der Anforderungen entstand eine Streamlit-Anwendung mit einer mehrstufigen Verarbeitungspipeline: After defining the requirements, a Streamlit application was built around a multi-stage processing pipeline:

  • Vorverarbeitung — Audio-Upload, Konvertierung auf Mono/16 kHz und Peak-Normalisierung.Pre-processing — audio upload, conversion to mono/16 kHz and peak normalisation.
  • Segmentierung — Sprachaktivitätserkennung mit Silero-VAD trennt den Mitschnitt in einzelne Sprechabschnitte.Segmentation — voice activity detection with Silero-VAD splits the recording into individual speech segments.
  • Transkription — jedes Segment wird per Speech-to-Text verarbeitet, wahlweise lokal über Whisper-REST oder online über OpenRouter.Transcription — each segment is processed via speech-to-text, either locally through Whisper-REST or online through OpenRouter.
  • Veredelung durch LLM — Vorgruppierung zu Funkverkehren, Grenzprüfung, Dialektkorrektur, Sender-/Empfänger-Erkennung und Klassifikation, gestützt auf eine domänenspezifische Ontologie mit Funkregeln, Rufzeichen und Ortsdaten.LLM refinement — pre-grouping into exchanges, boundary checking, dialect correction, sender/receiver identification and classification, supported by a domain-specific ontology of radio procedure, call signs and location data.
  • Human in the Loop — Korrektur in einer editierbaren Timeline, anschließend Export als JSON oder PDF.Human in the loop — correction in an editable timeline, followed by export as JSON or PDF.

Zur systematischen Bewertung unterschiedlicher STT- und LLM-Kombinationen entstand das eigene Auswertungswerkzeug EvalARCTA (auf Basis von jiwer). Es misst Word Error Rate (WER), Character Error Rate (CER), Zahlen-Accuracy, Real-Time-Factor (RTF) und Kosten — jeweils in zwei Normalisierungsmodi: „strict" und dem funkspezifischen Modus „radio". To systematically compare STT and LLM combinations, a dedicated evaluation tool EvalARCTA was developed (built on jiwer). It measures word error rate (WER), character error rate (CER), number accuracy, real-time factor (RTF) and cost — each in two normalisation modes: "strict" and the radio-specific mode "radio".

Ergebnisse — Phase 1Results — phase 1

Die erste Projektphase (PT1) ist am 08.07.2026 abgeschlossen worden: In der Masterklasse entstanden Programm und Verarbeitungspipeline, im Kurs TUN Forsch wurden die eingesetzten Modelle evaluiert. Datengrundlage der ersten Evaluierung war eine simulierte Hochwasser-Einsatzübung mit 791,6 Sekunden Audio. The first project phase (PT1) was completed on 8 July 2026: the application and processing pipeline were built in the master class, and the models were evaluated in the TUN Forsch course. The first evaluation was based on a simulated flood response exercise with 791.6 seconds of audio.

Das zentrale Ergebnis: jede LLM-Nachkorrektur verbessert die rohe STT-Ausgabe deutlich. Im radio-Modus sank die Word Error Rate von 18,5 % auf bis zu 4,8 %. Die beste Kombination — STT-Modell microsoft/mai-transcribe-1.5 mit dem Korrektur-LLM gemini-3.5-flash:nitro — wird für den untersuchten Anwendungsfall empfohlen. The key finding: every LLM post-correction improves the raw STT output substantially. In radio mode, the word error rate dropped from 18.5 % to as low as 4.8 %. The best combination — STT model microsoft/mai-transcribe-1.5 with correction LLM gemini-3.5-flash:nitro — is recommended for the use case examined.

4,8 % WER, bestes Modell
(roh: 18,5 %)
WER, best model
(raw: 18.5 %)
3,2 % CER
100 % Zahlen-AccuracyNumber accuracy
0,43 Real-Time-Factor
schneller als Echtzeit
Real-time factor
faster than real time
0,575 $ Kosten pro DurchlaufCost per run

Lessons LearnedLessons learned

Die rechtliche Verfügbarkeit echter Funkdaten ist in Österreich stark eingeschränkt — die Evaluierung musste deshalb auf einer simulierten Übung aufbauen. Mundart und undeutliche Aussprache bleiben die größte technische Hürde: Sie treffen die Speech-to-Text-Stufe direkt, und was dort verloren geht, kann auch ein nachgeschaltetes LLM nur teilweise rekonstruieren. The legal availability of real radio data is heavily restricted in Austria, so the evaluation had to be based on a simulated exercise. Dialect and unclear pronunciation remain the biggest technical hurdle: they hit the speech-to-text stage directly, and what is lost there can only be partly reconstructed by a downstream LLM.

Wie es weitergehtWhat's next

Das Gesamtprojekt läuft weiter. Geplant sind die Optimierung von Ontologie und Systemprompts, eine verbesserte Segmentierung, die Erweiterung auf einen kontinuierlichen Live-Audio-Feed, Tests mit echten Funkgeräten und SDR-Empfängern, Speech-to-Text für österreichischen Dialekt sowie die Themen Skalierbarkeit und Datenschutz. Die Evaluierung soll auf einen größeren Korpus ausgeweitet werden, um die Ergebnisse statistisch abzusichern. Eine Masterarbeit zu diesem Thema ist in Vorbereitung. The overall project continues. Planned next steps include optimising the ontology and system prompts, improved segmentation, extension to a continuous live audio feed, tests with real radios and SDR receivers, speech-to-text for Austrian dialect, and work on scalability and data protection. The evaluation is to be extended to a larger corpus to put the results on a firmer statistical footing. A master's thesis on the topic is in preparation.

  • TypTypeMasterprojekt (Masterklasse MKL / TUN Forsch), Grundlage für geplante MasterarbeitMaster's project (master class MKL / TUN Forsch), basis for planned master's thesis
  • ZeitraumPeriod2026 — laufend; Phase 1 abgeschlossen am 08.07.20262026 — ongoing; phase 1 completed 8 July 2026
  • BereichFieldSpeech-to-Text, Large Language Models, NLP, Audioverarbeitung, BOS-/FeuerwehrfunkSpeech-to-text, large language models, NLP, audio processing, emergency service radio
  • WerkzeugeToolsPython, Streamlit, Whisper-REST, Ollama, OpenRouter, Silero-VAD, pydub/ffmpeg, ReportLab, jiwer
  • StatusStatusPhase 1 abgeschlossen, Gesamtprojekt laufendPhase 1 completed, overall project ongoing