Alle Fragen

Interview üben (live, KI)

Bewertet die KI auch, WIE ich spreche, nicht nur was?

Aktualisiert:

Kurz gesagt

Nicht direkt. Im Übungsinterview von SwissJobs.app hört die KI-Stimme dich zwar live, doch die Note entsteht erst danach, und zwar aus der schriftlichen Abschrift deiner Antwort. Ein zweites Modell liest diesen Text und vergibt 0 bis 10 Punkte, gestützt auf Substanz, Struktur und Passung zur Person, die gefragt hat. Tonfall, Tempo, Lautstärke, Akzent und Pausen werden nicht gemessen. Indirekt zählt die Sprechweise trotzdem: Abbrüche, Wiederholungen, ein fehlender Schluss oder eine Antwort, die das Zeitlimit von drei Minuten sprengt, stehen im Text und drücken die Strukturnote.

Übe das Gespräch laut, und sieh, wie du abschneidest

Ein KI-Panel stellt die Fragen, du antwortest gesprochen wie im echten Gespräch. Danach bekommst du eine Bestehens-Wahrscheinlichkeit und die Stellen, an denen es gehakt hat.

Interview live üben

Das ist eine bewusste Grenze, keine Lücke im Kleingedruckten. Die Note misst, ob deine Antwort als Inhalt trägt. Ob du dabei ruhig, sicher und verständlich wirkst, beurteilt sie nicht, und im echten Gespräch in Zürich, Lausanne oder Lugano zählt genau das mit.

Für das Wie brauchst du einen anderen Spiegel: eine Videoaufnahme mit dem Handy, eine ehrliche Kollegin oder bei viel Einsatz einen Coach. Die Note sagt dir, was du sagen sollst; wie es ankommt, sagen dir Menschen.

  • Die Note entsteht aus der Abschrift deiner Antwort, nicht aus der Tonaufnahme.
  • Bewertet werden Substanz, Struktur und Passung zur fragenden Rolle, zusammen 0 bis 10 pro Antwort.
  • Tonfall, Tempo, Lautstärke, Akzent und Pausen misst niemand.
  • Indirekt zählt die Sprechweise: Abbrüche, Wiederholungen und ein fehlender Schluss stehen im Text.
  • Undeutliches Sprechen kann zu falsch abgeschriebenen Wörtern führen, und die Bewertung liest dann diese Wörter.
  • Für Auftreten und Stimme: Videoaufnahme, ehrliches Gegenüber oder Coach.

Zwei Schritte, zwei verschiedene Modelle

Das Übungsinterview besteht aus zwei Teilen, die leicht verwechselt werden. Im ersten Teil spricht eine KI-Stimme mit dir. Sie spielt das Panel, das du beim Einrichten angegeben hast, stellt eine Frage nach der anderen und darf eine kurze Nachfrage stellen, wenn deine Antwort vage geblieben ist. Dieser Teil hört dich tatsächlich: Dein Mikrofon liefert Ton, und die Stimme reagiert auf das Gesprochene.

Während des Gesprächs bewertet die Stimme nichts laut. Sie lobt nicht, sie korrigiert nicht, sie gibt keine Tipps. Das ist Absicht, denn ein echtes Panel kommentiert deine Antworten auch nicht zwischendurch.

Der zweite Teil beginnt, wenn du eine Antwort abschliesst. Dann wird die Abschrift der Frage und deiner Antwort an ein zweites Modell geschickt, das nur Text liest. Es kennt die Stelle, die Unternehmensgrösse und die Rolle der fragenden Person, und es liefert eine Note von 0 bis 10, zwei bis drei Sätze Begründung und einen Satz dazu, was eine starke Antwort zusätzlich enthalten hätte. Am Ende der Sitzung liest ein weiterer Durchgang alle Abschriften mitsamt Einzelnoten und schätzt daraus die Bestehens-Chance für diese Runde.

Was in der Abschrift steht und was nicht

In der Abschrift steht, welche Wörter du gesagt hast und in welcher Reihenfolge. Dazu gehören auch Dinge, die man für Sprechweise hält, die aber als Text sichtbar bleiben: ein Satz, den du abbrichst und neu beginnst, eine Aussage, die du dreimal wiederholst, eine Antwort, die mit «also, ja, genau» endet statt mit einem Ergebnis. Ebenfalls enthalten ist die Nachfrage des Panels, falls es eine gab, und deine Antwort darauf.

Nicht in der Abschrift steht alles, was nur im Ton liegt. Ob du zu schnell sprichst, ob deine Stimme am Satzende unsicher nach oben geht, wie lange du vor der Antwort überlegt hast, wie laut du bist, ob du lächelst: Nichts davon erreicht die Bewertung. Eine Kamera gibt es nicht, also auch keine Körpersprache, keinen Blickkontakt und keine Kleidung.

Füllwörter sind ein Grenzfall. Ob ein «ähm» in der Abschrift erscheint oder geglättet wird, entscheidet die automatische Transkription, nicht wir, und es ist nicht bei jeder Antwort gleich. Verlass dich darum nicht darauf, dass die Note deine Füllwörter zählt. Sie tut es nicht verlässlich.

Wo das Wie trotzdem in die Note durchsickert

Die Strukturnote ist die Stelle, an der Sprechweise indirekt zählt. Eine Antwort, die beim Allgemeinen beginnt, zu einem Beispiel springt, zurückkehrt und ohne Schluss aufhört, liest sich als Text genau so ungeordnet, wie sie klang. Das Modell sieht keinen nervösen Ton, aber es sieht den fehlenden Faden.

Das Zeitlimit ist die zweite Stelle. Pro Frage laufen höchstens drei Minuten, sichtbar heruntergezählt; bei null wird die Antwort automatisch abgeschlossen. Wer ausschweift, wird mitten im Satz abgeschnitten, und dem Text fehlt dann der Teil, auf den es ankam, meist das Ergebnis.

Die dritte Stelle ist die Verständlichkeit. Wer sehr schnell, sehr leise oder bei lautem Hintergrund spricht, riskiert falsch abgeschriebene Wörter. Aus einer Kennzahl wird dann eine andere, aus einem Fachbegriff ein Alltagswort. Die Bewertung liest, was abgeschrieben wurde, und kann nicht wissen, was du gemeint hast. Dein Akzent wird dabei nicht benotet; er zählt nur, falls er die Abschrift verfälscht. Im Bericht kannst du nachlesen, was angekommen ist.

Die vierte Stelle ist die Nachfrage. Stellt das Panel eine, war deine erste Antwort offenbar zu vage. Die Nachfrage selbst ist kein Minuspunkt, aber sie steht im Text und zeigt, dass die gesuchte Information in der ersten Antwort gefehlt hat.

Ein Beispiel: gleicher Inhalt, andere Reihenfolge

Die Frage kommt von der Teamleiterin in einem mittelgrossen Logistikunternehmen: «Erzählen Sie von einem Fehler, den Sie gemacht haben.» Die erste Version, so wie sie gesprochen und abgeschrieben wurde: «Also, ja, Fehler, das ist schwierig. Bei uns im Lager hatten wir, also eigentlich war es nicht nur mein Fehler, wir hatten eine falsche Inventur, nein, zuerst war die Bestellung falsch, und dann haben wir das halt korrigiert, und seither passe ich besser auf.»

Eine plausible Bewertung davon: 4 von 10. Begründung sinngemäss: Ein Beispiel ist vorhanden, aber ohne klare Reihenfolge, mit relativierter Verantwortung und ohne konkretes Ergebnis. Eine starke Antwort hätte gesagt, was genau schiefging, was du geändert hast und woran man sieht, dass es wirkt.

Die zweite Version enthält dieselben Fakten, nur geordnet und zu Ende gesprochen: «Ich habe eine Nachbestellung mit der falschen Einheit erfasst, Kartons statt Paletten. Aufgefallen ist es bei der Inventur. Ich habe die Differenz mit dem Lieferanten geklärt und seither eine Kontrollzeile in der Bestellvorlage eingeführt. In den Monaten danach gab es keinen solchen Fehler mehr.» Plausibel sind hier 7 oder 8 von 10.

Der Unterschied ist kein Tonfall. Es ist ein Faden, eine übernommene Verantwortung und ein Schlusssatz, alles Dinge, die als Text sichtbar sind. Beide Beispiele sind konstruiert und zeigen das Raster, keine garantierte Punktzahl.

Die zwei Fälle, in denen die Note dich täuschen kann

Erster Fall: Du sprichst ruhig, souverän und angenehm, sagst aber wenig Konkretes. Im echten Raum trägt dich das Auftreten ein Stück weit. Die Note sieht nur den dünnen Inhalt und fällt tief aus. Hier hat die Note recht, denn ein Schweizer Panel fragt spätestens beim zweiten Gespräch nach Belegen.

Zweiter Fall: Du hast starke, gut geordnete Antworten, bist aber sehr nervös, sprichst gehetzt und schaust auf den Tisch. Die Note fällt gut aus, weil der Text gut ist. Im echten Gespräch kann derselbe Inhalt schwächer wirken. Hier liegt die Note daneben, und genau das meint der Satz: Die Note kennt den Raum nicht.

Wer eine gute Note erreicht und trotzdem nach Gesprächen oft eine Absage bekommt, sollte deshalb das Auftreten prüfen, nicht noch einmal den Inhalt.

Hochdeutsch, Mundart und Fremdsprache

Die deutsche Stimme spricht Schweizer Geschäftsdeutsch, also Hochdeutsch, bei kleinen Firmen mit Du, bei grossen mit Sie. Mundart spricht sie nicht. Wie zuverlässig Schweizerdeutsch abgeschrieben wird, haben wir nicht gemessen. Übe darum auf Hochdeutsch, auch wenn das echte Gespräch später teilweise in Mundart läuft. Die Substanz deiner Antworten bleibt dieselbe.

Wer nicht in der Muttersprache antwortet, sollte wissen: Es gibt keine eigene Sprachnote. Die drei Kriterien sind Substanz, Struktur und Passung. Grammatikfehler stehen allerdings im Text, und ein Satz, der wegen der Grammatik unklar wird, ist auch inhaltlich unklar. Ein ausländischer Akzent wird nicht benotet.

Die Sitzung läuft in der Sprache, die du wählst: Deutsch, Englisch, Französisch oder Italienisch. Wer sich auf ein Gespräch in der Romandie vorbereitet, übt am besten auf Französisch, weil sich Formulierungen nicht eins zu eins übertragen lassen.

So übst du das Wie separat

Nutze zuerst den Bericht selbst als Spiegel. Lies deine Abschrift langsam durch. Abgebrochene Sätze, dreifache Wiederholungen und ein fehlender Schluss sind dort schwarz auf weiss sichtbar, auch wenn keine Zahl sie benennt.

Nimm dann dieselbe Antwort mit dem Handy auf Video auf, ohne abzulesen, und schau sie dir mit Ton an. Achte auf drei Dinge: Tempo, das Satzende und die ersten fünf Sekunden. Das kostet nichts und zeigt mehr über dein Auftreten als jede Note.

Wenn viel auf dem Spiel steht, ist ein Mensch der bessere Spiegel. Eine ehrliche Kollegin, die schon Bewerbungsgespräche geführt hat, merkt sofort, ob du überzeugend wirkst. Ein Coach lohnt sich bei einer Kaderstelle oder nach mehreren Absagen im letzten Schritt. In vielen Schweizer Städten gibt es zudem Toastmasters-Clubs, in denen man freies Sprechen vor Publikum übt.

Die sinnvolle Arbeitsteilung: Mit dem Übungsinterview machst du den Inhalt stark und passend zur Rolle, bis die Noten stabil sind. Das Auftreten übst du danach mit Aufnahme oder Mensch, mit Antworten, die bereits tragen.

Was die Note nicht verspricht

Die Note vergleicht deine Antwort mit einem Raster: Substanz, Struktur, Passung für diese Stelle, diese Unternehmensgrösse und diese Rolle. Sie misst nicht, ob du die Stelle bekommst. Eine 9 garantiert keine Zusage, und eine 5 heisst nicht, dass du chancenlos bist.

Im echten Gespräch zählen Dinge, die kein Text zeigt: die Chemie mit dem Team, interne Kandidaten, Budget und Timing. Nutze die Note als Arbeitsauftrag für deine nächste Antwort, nicht als Prognose.

Ablauf von Gespräch und Bewertung (Live-Stimme, Bewertung aus der Abschrift, 0 bis 10 pro Antwort mit Substanz, Struktur und Passung, Bestehens-Chance aus allen Abschriften, höchstens drei Minuten pro Frage, eine Nachfrage) am 16.09.2026 in der Implementierung des Übungsinterviews von SwissJobs.app geprüft. Das Antwortbeispiel ist konstruiert und illustriert das Raster; die genannten Noten sind plausible Werte, keine garantierten Ergebnisse.

Interview üben, live, mit KI-Stimme und Bewertung

Verwandte Fragen

← Alle Fragen

Was unser Stellenindex über den Schweizer Markt sagt

Live aus unserem eigenen Index berechnet, nicht aus einer Studie zitiert. Nur Anteile, Stand heute.

Sprache der Inserate

Deutsch
60%
English
23%
Français
13%
Italiano
3%

Von den Inseraten mit Sprachanforderung verlangen

Deutsch
70%
English
43%
Français
21%
Italiano
3%

19% in den letzten 7 Tagen ausgeschrieben · Grösste Märkte: Zürich 18% · Bern 10% · Genève 5% · Basel 5%