Klassifikation im grossen Stil

Zehntausend Einträge sortieren, ohne zehntausend Einträge zu lesen.

Kompakte Embedding-basierte Klassifikatoren labeln deine Dokumente, E-Mails und Tickets in grossen Mengen. Schnell, günstig pro Eintrag und vor dem Livegang an einer gelabelten Stichprobe gemessen.

Genauigkeit an deinen Daten gemessenLokal oder per APINiedrige Kosten pro Eintrag

[ 01 — DAS BEKOMMST DU ]

Ein Klassifikator, den du testen kannst.

Grosse Sprachmodelle können klassifizieren, sind bei hohem Volumen aber langsam und teuer. Kompakte Modelle erledigen die Masse, ein grosses Modell oder ein Mensch den unsicheren Rest.

  • [ 01 ]

    Label-Schema

    Eine klare Menge an Kategorien mit Definitionen und Grenzfällen, abgestimmt mit den Menschen, die das Ergebnis nutzen.
  • [ 02 ]

    Gelabelte Baseline

    Eine von deinen Fachleuten gelabelte Stichprobe. Sie ist der Massstab für jede Version des Klassifikators.
  • [ 03 ]

    Kompakter Klassifikator

    Ein Embedding-basiertes Modell, zum Beispiel ein Modell im JEPA-Stil, Open Source und lokal betrieben, oder über die API eines Anbieters, je nachdem, was zu deinen Datenregeln passt.
  • [ 04 ]

    Konfidenz und Routing

    Jeder Eintrag bekommt einen Score. Einträge mit niedriger Konfidenz gehen an einen Menschen oder ein grösseres Modell, statt geraten zu werden.
  • [ 05 ]

    Gemessene Genauigkeit

    Precision und Recall pro Kategorie auf zurückgehaltenen Daten, dazu jeden Monat eine Kontrolle an frischen Stichproben.

[ 02 — ABLAUF ]

Labeln, trainieren, messen, betreiben.

Die gelabelte Stichprobe entscheidet, was gut genug ist.

  1. 01

    Kategorien festlegen

    Wir erarbeiten mit deinem Team ein Label-Schema und klären die uneindeutigen Fälle schriftlich.1 Woche
  2. 02

    Baseline aufbauen

    Deine Fachleute labeln eine Stichprobe. Wir unterstützen mit Tooling und prüfen die Übereinstimmung zwischen den Labelnden.1 bis 2 Wochen
  3. 03

    Trainieren und auswerten

    Wir vergleichen Kandidaten auf zurückgehaltenen Daten und berichten die Genauigkeit pro Kategorie, auch dort, wo es scheitert.2 Wochen
  4. 04

    Betreiben und überwachen

    Klassifikation im Batch oder live, mit Konfidenzschwellen, einer Review-Queue und monatlichen Nachprüfungen.Laufend

[ 03 — ANWENDUNGSFÄLLE ]

Mengen, die passen.

Typische Szenarien. Keines davon beschreibt einen bestimmten Kunden.

Sortierung eines gemeinsamen Postfachs

Heute
Mitarbeitende lesen jede Mail, um zu entscheiden, welches Team zuständig ist.
Mit dem Workflow
Der Klassifikator weist Team und Thema zu. Mails mit niedriger Konfidenz landen in einer Review-Queue.

Tagging eines Dokumentenarchivs

Heute
Jahre an Scans und PDFs haben keinen einheitlichen Typ und keine Metadaten.
Mit dem Workflow
Ein Batch-Lauf vergibt die Dokumenttypen einmalig, und neue Dokumente werden beim Eingang getaggt.

Ticket-Kategorisierung

Heute
Kategorien werden von Hand gewählt und driften mit der Zeit.
Mit dem Workflow
Der Klassifikator schlägt eine Kategorie mit Score vor. Sachbearbeitende bestätigen oder korrigieren, und die Korrekturen fliessen in die nächste Version.
BEISPIEL — ILLUSTRATIVE DATEN, KEIN KUNDENERGEBNIS

[ 04 — UMFANG & PREIS ]

Ein Proof of Concept mit gemessenem Ergebnis.

Proof of Concept Klassifikation · 4 bis 6 Wochen

ab CHF 9'500fester Umfang · exkl. MWST

Die laufenden Kosten hängen von Volumen und Hosting ab und sind vor dem Rollout bekannt. Erweiterungen: CHF 2'200 pro Tag.

  • Label-Schema und gelabelte Baseline
  • Kandidaten-Klassifikatoren auf zurückgehaltenen Daten verglichen
  • Genauigkeit pro Kategorie, auch die Fehlschläge
  • Konfidenzschwellen und Design der Review-Queue

[ 05 — FRAGEN ]

Was Leute zur Klassifikation fragen.

Wie genau wird das?

Wir versprechen vorab keine Zahl. Wir messen sie an deiner gelabelten Stichprobe und gehen nur live, wenn sie die Schwelle erreicht, die du festlegst.

Wie viele gelabelte Daten brauchen wir?

Oft reichen einige hundert Beispiele pro Kategorie für den Start, bei einfachen Schemata weniger. Wir sagen dir nach einem ersten Test, wie viele es sind.

Warum nicht einfach ein grosses Sprachmodell nehmen?

Bei kleinen Mengen kannst du das. Bei Zehntausenden Einträgen sind kompakte Klassifikatoren schneller und günstiger, und für die unsicheren Fälle setzen wir trotzdem ein grosses Modell ein.

Geht das, ohne Dokumente an einen externen Anbieter zu schicken?

Ja. Open-Source-Embedding-Modelle laufen auf deinen eigenen Servern, sodass die Inhalte bei dir bleiben.

Was passiert, wenn sich die Kategorien ändern?

Wir passen das Schema an, ergänzen gelabelte Beispiele und werten neu aus. Versionsverlauf und Ergebnisse bleiben erhalten, damit du vergleichen kannst.

Bring eine Stichprobe dessen mit, was sortiert werden muss.

Wir testen einen kleinen Satz und zeigen dir die Genauigkeit, bevor du entscheidest.

Kennenlerngespräch buchen