# Sprecherzuordnung im Transkript

> Beschrifte Transkriptsegmente mit einem konfigurierten Diarisierungsmodell.

[Open tool](https://www.toolcabana.com/de/speaker-transcript) · [Audio, Video und Dateien](https://www.toolcabana.com/de/category/audio-video-and-files)

Tool ID: speaker-transcript. Requested language: de. Description language: de. Complete guide translation: yes.

## Supported tasks (de)

Whisper-Wortzeitstempel im Browser werden innerhalb eines 10-Sekunden-Ausschnitts mit der Pyannote-Segmentierung abgeglichen, mit bis zu drei anonymen Sprecher-Slots. Die Labels identifizieren keine Personen und bleiben nicht über mehrere Durchläufe hinweg erhalten. Prüfe Überlappungen und kurze Redebeiträge.

## Steps (de)

1. Wähle eine Quelldatei aus. Wenn das Tool mehrere Dateien akzeptiert, ordne sie in der gewünschten Reihenfolge an.
2. Lege den Sprachcode (leer = erkennen) und die maximalen Sekunden fest.
3. Führe die Sprecherzuordnung im Transkript aus, prüfe die Ausgabe und verwende dann die verfügbaren Bedienelemente zum Kopieren oder Herunterladen.

## Settings

- Sprachcode (leer = erkennen) (de; key: language; type: text)
- Maximale Sekunden (de; key: duration; type: number); minimum: 1; maximum: 10

## Limitations (de)

Bis zu 10 Sekunden, drei anonyme Sprecher-Slots. Labels gelten nur innerhalb des ausgewählten Ausschnitts und sind keine Sprecheridentitäten. Die erste Inferenz lädt Transkriptions- und Segmentierungsmodelle herunter.

## Example input

```text
A useful tool makes everyday work easier. Review the results before sharing.
```

## Privacy and connections (de)

Quelldateien und Text bleiben in diesem Browser. Beim ersten Durchlauf werden öffentliche Modelle von Hugging Face und lokale Laufzeit-Assets von der Website heruntergeladen. Modelle können im Browsercache verbleiben. Es ist kein Upload der Quelle zu Vercel, Supabase oder einem Konvertierungsdienst erforderlich.

## Questions (de)

### Was macht die Sprecherzuordnung im Transkript?

Whisper-Wortzeitstempel im Browser werden innerhalb eines 10-Sekunden-Ausschnitts mit der Pyannote-Segmentierung abgeglichen, mit bis zu drei anonymen Sprecher-Slots. Die Labels identifizieren keine Personen und bleiben nicht über mehrere Durchläufe hinweg erhalten. Prüfe Überlappungen und kurze Redebeiträge.

### Wo wird meine Eingabe verarbeitet?

Quelldateien und Text bleiben in diesem Browser. Beim ersten Durchlauf werden öffentliche Modelle von Hugging Face und lokale Laufzeit-Assets von der Website heruntergeladen. Modelle können im Browsercache verbleiben. Es ist kein Upload der Quelle zu Vercel, Supabase oder einem Konvertierungsdienst erforderlich.

### Welche Eingabelimits gelten?

Bis zu 10 Sekunden, drei anonyme Sprecher-Slots. Labels gelten nur innerhalb des ausgewählten Ausschnitts und sind keine Sprecheridentitäten. Die erste Inferenz lädt Transkriptions- und Segmentierungsmodelle herunter.

## Related tools

- [Automatic subtitle generator](https://www.toolcabana.com/de/auto-subtitles)
- [Burn subtitles into video](https://www.toolcabana.com/de/burn-subtitles)
- [Word-highlight subtitles](https://www.toolcabana.com/de/word-subtitles)
- [Subtitle translator](https://www.toolcabana.com/de/subtitle-translate)
