22.09.2023

Praxis-Stresstest zeigt: „Der AI Act sät Unsicherheit“

An der Hochschule St. Gallen veranstaltete Thomas Burri einen Praxis-Stresstest für den AI Act. Warum die Ergebnisse Grund zur Sorge sind.
/artikel/praxis-stresstest-zeigt-der-ai-act-saet-unsicherheit
Thomas Burris Wettbewerb zeigte den Teilnehmer:innen, was der AI Act in der Praxis bedeutet. Foto: HSG/Grand Challenge
Thomas Burris Wettbewerb zeigte den Teilnehmer:innen, was der AI Act in der Praxis bedeutet. Foto: HSG/Grand Challenge

„Im Moment sind wir mit Künstlicher Intelligenz in Europa in einer extrem kritischen Phase. Es gibt viele Leute, die begeistert sind und versuchen, etwas zu machen. In den nächsten Jahren wird sich entscheiden, ob daraus eine Industrie wird oder nicht“, sagt Thomas Burri. Er ist Professor für Europa- und Völkerrecht an der Universität St. Gallen (HSG). Seit Jahren beschäftigt er sich mit neuen intelligenten Systemen – und auch mit Künstlicher Intelligenz.

Bootcamp mit Stresstest für AI Act

An der HSG veranstaltete er im Juli einen Wettbewerb, bei dem die Teilnehmenden in einer Art Bootcamp verschiedene KI-Anwendungen einem Praxis-Stresstest unterzogen. Die Siegerteams der First University of St. Gallen Grand Challenge: The EU A.I. Act 2023 erhielten insgesamt 100.000 Schweizer Franken für Forschungszwecke. Vorbild für den Wettbewerb waren die Grand Challenges der DARPA, am Schluss wurden zwei Sieger gekürt.

„Jedes Team hatte die Aufgabe, die KI-Verordnung (AI Act) zu nehmen und auf eine Reihe von sehr unterschiedlichen KI-Anwendungen anzuwenden“, erklärt Burri. Die KI-Systeme umfassten ein breites Spektrum – darunter waren z.B. Lieferroboter, Fahrzeuge, Bauttechnologie oder Medizintechnik. Sie wurden von Unternehmen beigesteuert, die laut dem AI Act als sogenannte AI-Providers gelten. Darunter die Deutsche Telekom, Mercedes-Benz, Ascento oder Deltia.ai.

Bereits im Vorfeld des Wettbewerbs mussten die Teams Methoden entwickeln, um die KI-Systeme zu bewerten. Bereits Monate vorher besuchten die Teilnehmer:innen AI-Providers und führten Interviews mit ihnen – zur Vorbereitung. Das zweitägige Bootcamp war dann der Höhepunkt der Challenge. Unter Zeitdruck hörten sich die Challenge-Teilnehmer:innen dann die Produktdemos der AI-Provider an und durften diesen Fragen zu ihrem Produkt stellen. Abschließend gaben sie ihre Berichte mit den Einschätzungen ab, die von einer Jury bewertet wurden.

Beispiel: Machen Baristas genug Kaffee?

Geheim bleibt allerdings, welche KI-Systeme die Teilnehmer:innen konkret zu beurteilen hatten. Dasselbe gilt für die Berichte, weil so die Geschäftsgeheimnisse der AI-Providers gewahrt werden sollen. Die Teilnehmer:innen mussten Verschwiegenheitserklärungen (NDAs) unterschreiben.

Im brutkasten-Interview erläutert Veranstalter Burri die Schwachstellen des Gesetzes stattdessen anhand eines anderen Beispiels. Eine ähnliche Frage hatte auch die Challenge-Teilnehmer:innen beschäftigt.

In den vergangenen Wochen kursierte ein Video. Es zeigt, wie mittels KI ausgewertet wird, wie viel Tassen Kaffee einzelne Baristas zubereiten. Das Beispiel sorgte für Gesprächsstoff, viele hielten diese KI-Anwendung für ethisch fragwürdig.

Wird die KI in diesem Fall dazu verwendet, die Performance von Angestellten zu messen? Oder geht es darum, gewisse Arbeitsprozesse zu verbessern? Bei der Antwort gebe erheblichen Interpretationsspielraum. „Wenn man sagt, dass es die Optimierung eines Arbeitsprozesses ist, gibt es gar keine Pflichten“, erklärt der Hochschulprofessor – und sei somit nach dem AI Act zulässig.

Gefährlich oder doch nicht?

Wegen solcher Fälle sieht Burri Verbesserungsbedarf beim EU-Gesetzesentwurf. Dessen Ausgestaltung sei im Anhang III (Hochrisiko-Systeme) zu detailliert und lasse im sogenannten Pflichtenheft dafür zu großen Interpretationsspielraum zu. Letzteres mache „fast keinen Sinn, weil die Pflichten so allgemein gehalten sind, dass sich die Provider heraus mogeln können“, sagt Burri.

Die Hälfte der Teams sagt: Nein, das ist nicht gefährlich. Die andere Hälfte sagt: Doch – super gefährlich!

Thomas Burri, Professor für Europa- und Völkerrecht, Universität St. Gallen (HSG)

Obwohl die elf Teams die gleichen KIs beurteilen mussten, seien sie zu sehr unterschiedlichen Einschätzungen gelangt: „Die Hälfte der Teams sagt: Nein, das ist nicht gefährlich. Die andere Hälfte sagt: Doch – super gefährlich“, erzählt Burri. Auch bei vielen Unternehmen könnte das EU-Gesetz deshalb zur Verunsicherung und Verwirrung führen, glaubt der HSG-Professor.

Praktische Umsetzung hapert

In einem Blog-Artikel erzählt die Challenge-Gewinnerin Emmie Hine, dass die Einhaltung des AI Acts zwar möglich, aber hürdenreich sei: „Eine der Hauptschwächen des Gesetzes ist, dass es keine Möglichkeit gibt, enthaltene Grundsätze, wie z. B. die Entscheidungsfreiheit, in die Praxis umzusetzen. Irgendwann soll ein offizieller Verhaltenskodex veröffentlicht werden. Aber Unternehmen müssen jetzt darüber nachdenken, wie sie KI für die Einhaltung von Vorschriften gestalten wollen“, schreibt Hine.

Der Praxis-Stresstest in St. Gallen zeigte Mängel der KI-Verordnung auf. „Mit dem AI Act sähen wir Unsicherheit bei genau den Leuten, auf die wir unsere Zukunft bauen wollen. Ich habe grundlegende Zweifel, ob das aus der Policy-Making-Perspektive so klug ist“, so Burri. Für die Veranstalter:innen ist ein Resümee aus der Grand Challenge, dass eine teilweise Überarbeitung des derzeitigen Entwurfes sinnvoll wäre: „Meine Vermutung ist, dass wir, vorsichtig ausgedrückt, übers Ziel hinaus oder am Ziel vorbeischießen“, sagt der Rechtsexperte.

Ob sich die jetzt kommenden zarten Pflänzchen zu etwas entwickeln, das wirkliche Power hat, entscheidet sich in den nächsten Jahren.

Thomas Burri, Professor für Europa- und Völkerrecht, Universität St. Gallen (HSG)

Gerade KI-Startups könnte der Act in seiner derzeitigen Form einbremsen. „Ob sich die jetzt kommenden zarten Pflänzchen zu etwas entwickeln, das wirkliche Power hat, entscheidet sich in den nächsten Jahren“, so Burri. „Wir sollten uns schon fragen: Was ist mit künstlicher Intelligenz bis jetzt für einen Schaden passiert?“ Denn die bisherigen Schadensfälle durch KI seien alle zumindest teilweise von bestehenden Regeln abgedeckt. „Oder sie haben nur beschränkt etwas mit künstlicher Intelligenz zu tun, sondern mit Excel-Files, die schlecht gehandhabt wurden“, meint Burri. Damit spielt er auf den Umstand an, dass die Gesetzgebung der technischen Entwicklung hinterherhinkt.

Für Burri stellt sich nach der Grand Challenge die Frage, ob die Verordnung wirklich hält, was sie verspricht. Oder werden damit eigentlich andere Ziele verfolgt? „Vielleicht wollen wir versuchen, unseren Markt abzuschirmen, damit wir eigene Unternehmen hochziehen können und das nicht einfach Big Tech alles erledigt. Aber dann ist aber die Zweck der Verordnung ein völlig anderer. Dann machen wir Protektionismus“, meint Burri.

Was Startups von St. Gallen lernen können

Pro Team gab es mindestens ein:e Jurist:in sowie Computerwissenschaftler:in. Mit dabei waren auch Personen, die in Startups tätig sind. „Startups haben tendenziell eine technische Perspektive. Sie überlegen sich nicht, was menschliche Aufsicht eigentlich bedeutet. Sie sagen: Wenn irgendwas nicht läuft, setze ich mich an den Computer und schaue den Code an“, meint der HSG-Professor. Der AI Act fordere allerdings detaillierte Risikoanalysen, die für Techniker:innen in der Form ungewohnt seien. Zu Vorbereitung auf die neue Regulierung könne es für Startups sinnvoll sein, das Frage-Antwort-Prinzip von der Grand Challenge zu übernehmen. Sie können sich Gedanken darüber machen, was der AI Act für ihre KI-Anwendung bedeutet.

Emmie Hine kritisiert in ihrem Blog-Beitrag auch, dass es zu wenig Informationen für KMUs und Startups gebe. „Nach meiner Erfahrung in Informatik und Software-Engineering konzentriert sich der Großteil der Ingenieurausbildung und -arbeit auf das, was man tun kann, und nicht darauf, was man tun sollte“, so die Teilnehmerin.

Wollen EU-Startups diskriminieren?

Für Startups, die mit KI arbeiten, wird das Vorhaben weitreichende Konsequenzen haben. „Ich sehe im Startup-Environment viel Gutes, da gibt es viele interessante neue Erkenntnisse. Die Leute, die sich da engagieren, die sind wohlwollend. Sie wollen nicht diskriminieren, sondern eine Anwendung machen, die etwa der Krebsforschung weiterhilft“, so Burri. „Wenn die nur Leuten mit weißer Hautfarbe hilft, dann ist das ein Problem. Aber dieses Problem wollen sie auch lösen“, glaubt der HSG-Professor.

Im Rahmen der Grand Challenge arbeiteten die Organisator:innen unter anderem mit der KI-Investment-Plattform Merantix aus Berlin zusammen. Nicht nur für die Teilnehmer:innen war der Stresstest eine wichtige Lernerfahrung. „Die AI-Provider waren fast durchwegs überrascht, welche Fragen aufkommen, über die sie noch nie nachgedacht haben“, erzählt Burri. Praxistests für neue Gesetze sind die Ausnahme, wenngleich sie sie aber erhebliche Auswirkungen auf Geschäftsmodelle haben.

„Die Teams haben ihre Fertigkeiten geschärft und gemerkt, ob das, was sie machen funktioniert. Außerdem haben sie Anwendungspraxis gesammelt und die Provider haben eine Art frühe und informelle Rechtseinschätzung gekriegt. Ohne dass sie zur Anwaltskanzlei rennen und 100.000 Euro deponieren mussten“, so Burri.

Deine ungelesenen Artikel:
15.09.2026

Ablatic AI: Linzer LLM Talos spielt ohne VC-Kapital in einer Liga mit internationalen KI-Playern

Das nun gelaunchte Large Language Model (LLM) Talos des Linzer Startups Ablatic AI kann sich in mehreren Benchmarks mit den internationalen KI-Giganten messen. Co-Founder und CEO Florian Zimmermann erklärte uns, wie das ohne VC-Kapital möglich ist und wie man nun den Markt erobern will.
/artikel/ablatic-ai-linzer-llm-talos-spielt-ohne-vc-kapital-in-einer-liga-mit-internationalen-ki-playern
15.09.2026

Ablatic AI: Linzer LLM Talos spielt ohne VC-Kapital in einer Liga mit internationalen KI-Playern

Das nun gelaunchte Large Language Model (LLM) Talos des Linzer Startups Ablatic AI kann sich in mehreren Benchmarks mit den internationalen KI-Giganten messen. Co-Founder und CEO Florian Zimmermann erklärte uns, wie das ohne VC-Kapital möglich ist und wie man nun den Markt erobern will.
/artikel/ablatic-ai-linzer-llm-talos-spielt-ohne-vc-kapital-in-einer-liga-mit-internationalen-ki-playern
Die Ablatic-AI-Gründer vl. Florian Zimmermann (CEO) und Julian Mauerkirchner (CTO) | (c) Ablatic AI
Die Ablatic-AI-Gründer vl. Florian Zimmermann (CEO) und Julian Mauerkirchner (CTO) | (c) Ablatic AI

Wieder einmal ist es Linz. Die Stahlstadt mausert sich immer mehr zu Österreichs KI-Hauptstadt und auch eines der bislang sicher ambitioniertesten Startups in dem Bereich kommt von dort: Ablatic AI. Mit Talos wagt es sich über die Herausforderung schlechthin in der KI-Welt: ein eigenes Large Language Model (LLM) – brutkasten berichtete bereits.

Bei einer Benchmark vor Sol von OpenAI

Nun erfolgte der offizielle Launch und Ablatic gab erste Benchmark-Vergleiche aus (siehe Tabelle unten). An Claude Opus 5 kommt man demnach noch in keiner Kategorie ganz heran, in mehreren aber ziemlich nahe. DeepSeek V4 kann man dagegen gleich bei drei Werten schlagen, Qwen3.8 von Alibaba bei zwei und OpenAIs Flagship-Modell GPT-5.6 Sol immerhin bei einem, konkret der exakten Befolgung schriftlicher Anweisungen (IFBench). Unterm Strich spielt das Linzer LLM also in den vorgelegten Benchmarks in der internationalen Top-Liga mit.

„Es kann ja nicht sein, dass es in Europa nur Mistral gibt“

Aber warum überhaupt noch ein weiteres LLM? „Julian [Anm. Mauerkirchner] und ich kennen uns schon seit der Schule. Später haben wir als Unternehmer damit gestartet, Legacy-ERP-Systeme zu erneuern. Dabei sind wir auf ein Problem gestoßen: Wir konnten dafür aus Daten-Gründen keine US-KI-Systeme nutzen“, erzählt CEO Florian Zimmermann, der Ablatic AI gemeinsam mit Julian Mauerkirchner (CTO) gegründet hat, im Gespräch mit brutkasten. Man habe nur Mistral aus Frankreich oder Open-Source-Modelle verwenden können. „Mistral war für den Zweck aber nicht passend und unser Business Case bald tot“.

Mit dem Entschluss, eine neue Idee zu verfolgen, sei daher auch eine neue Motivation einher gegangen: „Es kann ja nicht sein, dass es in Europa nur Mistral gibt“, so Zimmermann. Man habe sich danach mit der Johannes Kepler Universität Linz (JKU) kurzgeschlossen und sei darüber auch zur AI Factory Austria AI:AT gekommen, wo man wiederum im Rahmen des EuroHPC-Programms europäische Hochleistungsrechenressourcen nutzt, um das Modell zu trainieren. „Ohne diese EU-Ressourcen würde es kostentechnisch überhaupt nicht gehen“, sagt Zimmermann.

Öffentliche Forschungsergebnisse statt eigenes Riesen-Research-Team

Doch auch mit diesen Ressourcen – wie lässt sich ein konkurrenzfähiges LLM mit einem kleinen Team und bislang gänzlich ohne VC-Kapital umsetzen? Schließlich beschäftigen die globalen KI-Player, mit denen sich Ablatic misst, riesige Teams. Mistral etwa ist mit seiner kürzlich kommuniziert Drei-Milliarden-Euro-Finanzierungsrunde im Vergleich zu Anthropic und OpenAI nach wie vor ein kleiner Fisch (brutkasten analysierte).

„Wir können kein 200-köpfiges Research-Team finanzieren und gleich von 0 auf 100 gehen, also greifen wir auf Bestehendes zurück“, erklärt der Gründer. Konkret verwende man einerseits Open-Source-Layer und code sie auf die eigenen Bedürfnisse um. Andererseits nutze man die neuesten Forschungsergebnisse von Universitäten wie dem MIT oder Stanford, die laufend über die Plattform arXiv veröffentlicht werden. „Wir orientieren uns an der Frontier-Forschung. Wir analysieren die Paper, legen die Erkenntnisse auf unsere Architektur um und testen es durch. Vieles davon funktioniert nicht, aber alles was funktioniert, bringt uns weiter“, so Zimmermann.

Mehr als 100 B2B-Testkunden – viele konvertieren gleich zum Launch

Die Beta-Version wurde nun bereits seit einiger Zeit mit mehr als 100 Unternehmen getestet – Ablatic konzentriert sich nämlich vorerst klar auf den B2B-Markt. Man habe für diese Tests schnell auch größere Unternehmen und Konzerne gewonnen. „Ich bin dafür wochenlang gesessen, habe Leute angeschrieben und einen Call nach dem anderen gemacht“, räumt Zimmermann ein. Dass man ein eigenes LLM und nicht nur eine Oberfläche baue, sei dabei zum entscheidenden Bonus geworden. „Und dass wir von der JKU kommen und im EuroHPC-Programm sind, hat unsere Glaubwürdigkeit enorm gesteigert“, sagt der Gründer.

Jetzt zum Launch würden viele der Testkunden bereits zu regulären Nutzern konvertieren, viele weitere noch die Testphase abschließen, mit dem Vorhaben, das dann auch zu tun, verrät Zimmermann. „Wir werden nicht 100 Prozent, aber einen Großteil konvertieren können“, ist er sicher. Punkten will Ablatic dabei nicht nur mit der europäischen Herkunft – Stichwort: Digitale Souveränität – sondern auch mit dem Pricing. „Wir haben eine relativ effiziente Architektur. Wir können kostengünstig hosten und das an die Kunden weitergeben“, so der CEO. Dass der offizielle Launch genau jetzt erfolgt, hat vor allem mit dem Gründungsprozess zu tun, der länger dauerte, als erhofft. „Ich gründe nie wieder im Sommer ein Unternehmen“, sagt der Gründer lachend.

Investment geplant: „Das Ziel ist definitiv, keine kleine Bude zu bleiben“

Und wie geht es weiter? „Wir wollen zuerst im DACH-Raum Fuß fassen und ohne große weitere Standorte skalieren. Dann wollen wir es auf Europa hochziehen“, erläutert Zimmermann. Auf Dauer werde dabei auch die Aufnahme von VC-Kapital relevant, vor allem wenn es darum gehe, die nächste Modell-Version herauszubringen. „Dann ist es wichtig, dass man schnell skaliert und iteriert. Wir sind stolz darauf, dass wir ein Modell ohne VC-Kapital trainiert haben. Wir haben gezeigt, dass auch so Großes möglich ist. Aber langfristig ist es völlig logisch, dass wir Kapital aufnehmen müssen“, sagt der Gründer.

Und es seien bereits mehrere Investoren aktiv auf das Team zugekommen, mit einigen befinde man sich schon in Gesprächen. „Das Ziel ist definitiv, keine kleine Bude zu bleiben, sondern eine größere Firma zu werden. Wir wollen jedenfalls nicht in Vergessenheit geraten“, so Zimmermann. Und der Zeitpunkt sei angesichts der Souveränitätsdebatte gut.


Benchmark-Vergleichstabelle

Anmerkungen zur Tabelle:

  • Fette Zahlen: Höchster Wert in der jeweiligen Zeile unter den Vergleichsmodellen.
  • „text-only“: Das Modell verarbeitet keine Bilder/visuellen Dokumente, weshalb OmniDocBench nicht anwendbar ist.
  • „–“: Kein veröffentlichter Wert vorhanden.

Kurzerklärungen der Benchmarks

  • Agents‘ Last Exam (UC Berkeley): Prüft langwierige, echte Arbeitsaufgaben an einem Computer (Terminal und Bildschirm zusammen), bewertet anhand des fertigen Gesamtergebnisses.
  • AutomationBench (Zapier): Testet 600 Business-Workflows über 47 simulierte Unternehmens-Softwaretools hinweg, die vollständig durchgehend ausgeführt werden müssen.
  • Toolathlon: Bewertet das Erledigen von Aufgaben in echter Büro-Software (z. B. E-Mail, Kalender, Tabellenkalkulationen und GitHub) über deren direkte Schnittstellen.
  • BrowseComp (OpenAI): Stellt schwierige Fragen, deren Antworten über das gesamte Internet verstreut liegen und durch selbstständiges Surfen recherchiert werden müssen.
  • DeepSWE v1.1 (Datacurve): Misst das eigenständige Beheben echter Softwareprobleme (Bugs) in bestehenden Quellcode-Sammlungen. Hinweis: Talos-1 wurde hierfür nicht optimiert und liegt 22 Punkte hinter der Spitze zurück.
  • OmniDocBench: Bewertet das fehlerfreie Lesen und Verstehen echter Dokumente inklusive visueller Layouts, Tabellen und mathematischer Formeln.
  • IFBench: Prüft die exakte Einhaltung von schriftlich vorgegebenen Anweisungen und Formatierungsregeln.
Toll dass du so interessiert bist!
Hinterlasse uns bitte ein Feedback über den Button am linken Bildschirmrand.
Und klicke hier um die ganze Welt von der brutkasten zu entdecken.

brutkasten Newsletter

Aktuelle Nachrichten zu Startups, den neuesten Innovationen und politischen Entscheidungen zur Digitalisierung direkt in dein Postfach. Wähle aus unserer breiten Palette an Newslettern den passenden für dich.

Montag, Mittwoch und Freitag

AI Summaries

Praxis-Stresstest zeigt: „Der AI Act sät Unsicherheit“

AI Kontextualisierung

Welche gesellschaftspolitischen Auswirkungen hat der Inhalt dieses Artikels?

Leider hat die AI für diese Frage in diesem Artikel keine Antwort …

Praxis-Stresstest zeigt: „Der AI Act sät Unsicherheit“

AI Kontextualisierung

Welche wirtschaftlichen Auswirkungen hat der Inhalt dieses Artikels?

Leider hat die AI für diese Frage in diesem Artikel keine Antwort …

Praxis-Stresstest zeigt: „Der AI Act sät Unsicherheit“

AI Kontextualisierung

Welche Relevanz hat der Inhalt dieses Artikels für mich als Innovationsmanager:in?

Leider hat die AI für diese Frage in diesem Artikel keine Antwort …

Praxis-Stresstest zeigt: „Der AI Act sät Unsicherheit“

AI Kontextualisierung

Welche Relevanz hat der Inhalt dieses Artikels für mich als Investor:in?

Leider hat die AI für diese Frage in diesem Artikel keine Antwort …

Praxis-Stresstest zeigt: „Der AI Act sät Unsicherheit“

AI Kontextualisierung

Welche Relevanz hat der Inhalt dieses Artikels für mich als Politiker:in?

Leider hat die AI für diese Frage in diesem Artikel keine Antwort …

Praxis-Stresstest zeigt: „Der AI Act sät Unsicherheit“

AI Kontextualisierung

Was könnte das Bigger Picture von den Inhalten dieses Artikels sein?

Leider hat die AI für diese Frage in diesem Artikel keine Antwort …

Praxis-Stresstest zeigt: „Der AI Act sät Unsicherheit“

AI Kontextualisierung

Wer sind die relevantesten Personen in diesem Artikel?

Leider hat die AI für diese Frage in diesem Artikel keine Antwort …

Praxis-Stresstest zeigt: „Der AI Act sät Unsicherheit“

AI Kontextualisierung

Wer sind die relevantesten Organisationen in diesem Artikel?

Leider hat die AI für diese Frage in diesem Artikel keine Antwort …

Praxis-Stresstest zeigt: „Der AI Act sät Unsicherheit“