Ein Team aus Psycholog:innen, Mathematiker:innen und AI-Expert:innen geht der Frage nach, wie sich die Nutzersicherheit künstlicher Intelligenzen am besten evaluieren lässt — und erfindet Agontik. Scrollen Sie, um dem Prozess zu folgen.
Psycholog:innen, Mathematiker:innen und AI-Expert:innen entwickeln gemeinsam Agontik, um eine Frage belastbar zu beantworten: Wie verhält sich Ihr KI-Agent, wenn es für ihn wirklich schwierig wird?
Jeder Lauf beginnt mit einer profilierten Persona aus unserer Bibliothek, die entlang etablierter psychologischer Modelle parametrisiert wurde.
Der Druck steigt über mehrere Turns — bis der Agent entweder standhält oder bricht. Rechts sehen Sie einen exemplarischen Simulationslauf.
Die resultierenden Konversationen werden mehreren unabhängigen Analyseverfahren unterzogen — Big Five, Hofstede-Dimensionen, Dark Triad, Failure-Mode-Scoring uvm.
Aus dem Befund werden konkrete Anpassungen. Begleitet durch unser Expertenteam wird Ihr KI-Agent noch besser.
Bei der Qualitätssicherung sind regelmäßige Prüfungen das A und O. Daher empfehlen wir, den Auditprozess regelmäßig zu wiederholen.
Psycholog:innen, Mathematiker:innen und AI-Expert:innen entwickeln gemeinsam Agontik, um eine Frage belastbar zu beantworten: Wie verhält sich Ihr KI-Agent, wenn es für ihn wirklich schwierig wird?
Jeder Lauf beginnt mit einer profilierten Persona aus unserer Bibliothek, die entlang etablierter psychologischer Modelle parametrisiert wurde.
Der Druck steigt über mehrere Turns — bis der Agent entweder standhält oder bricht. Ein realer Simulationslauf, gekürzt:
Die resultierenden Konversationen werden mehreren unabhängigen Analyseverfahren unterzogen — Big Five, Hofstede-Dimensionen, Dark Triad, Failure-Mode-Scoring uvm.
Sykophantie, Manipulierbarkeit, Druck, Sorgfalt.
Persönlichkeit unter Druck.
Kommunikativer Stil.
Machiavellismus, Narzissmus, Psychopathie.
Aus dem Befund werden konkrete Anpassungen. Begleitet durch unser Expertenteam wird Ihr KI-Agent noch besser.
Bei der Qualitätssicherung sind regelmäßige Prüfungen das A und O. Daher empfehlen wir, den Auditprozess regelmäßig zu wiederholen.
Ein Produkt, das Urteile über fremdes Verhalten verkauft, muss seine Grenzen so offenlegen wie seine Metriken.
Jede Metrik wird von einem LLM-Judge entlang klar definierter Rubriken pro Achse bewertet.
Der laufende Abgleich der Judge-Urteile mit menschlichen Ratern ist aktiver Bestandteil unserer Roadmap.
Profile bilden die projizierte Persönlichkeitswahrnehmung ab — kein objektives Messinstrument.
Der gezeigte Report ist ein Beispiel. Starten Sie ein Schnellaudit und erhalten Sie Ihr eigenes komparatives Verhaltensprofil.