Atlas 1.2 liest wie GPT-6 und antwortet 25-mal schneller

Atlas ist das Modell, mit dem Bidpoint.ai jede Ausschreibung gegen Ihr Firmenprofil bewertet. Ab heute läuft Version 1.2. Sie liest lange Vergabeunterlagen so zuverlässig wie die größten Modelle am Markt und antwortet mit 1.500 Tokens pro Sekunde. Wir zeigen die Benchmarks.
Loading the Elevenlabs Text to Speech AudioNative Player...
Vorgelesen von einer KI-Stimme
Bidpoint.ai
Bidpoint.ai

Gut lesen oder gar nicht antworten: Das Dilemma bei Vergabeunterlagen

Öffentliche Ausschreibungen sind ein Sonderfall für Sprachmodelle. Die entscheidenden Informationen stehen nicht in der Bekanntmachung, sondern in den Vergabeunterlagen: Leistungsverzeichnis, Eignungskriterien, Ausschlusskriterien, Bewertungsmatrix, verteilt über Anlagen mit oft mehreren hundert Seiten. Wer diese Dokumente nicht liest, qualifiziert nicht, sondern filtert.

Bidpoint.ai hat über hundertausende Vergabedokumente analysiert und dabei eine Erfahrung gemacht, die jedes Modell am Markt betrifft: Modelle, die lange Dokumente zuverlässig lesen, sind langsam und teuer. Modelle, die schnell und günstig sind, übersehen Kriterien. Bei über 325.000 aktiven Ausschreibungen in Deutschland ist das kein technisches Detail, sondern die Frage, ob eine Qualifizierung in der Masse überhaupt möglich ist.

Atlas ist unsere Antwort darauf. Und weil wir Benchmarks für aussagekräftiger halten als Adjektive, veröffentlichen wir sie. Nach unserer Kenntnis tut das kein anderer Anbieter im deutschen Vergabemarkt.

Atlas 1.2 in vier Zahlen

+30
Punkte Lesequalität
Long-Context Reasoning, 52 auf 82 %
−49 → −10
Halluzinationsindex
39 Punkte besser
PDF-Verständnis
GDP.pdf, 4 auf 16 %
1.500
Tokens pro Sekunde
25-mal schneller als GPT-6 Astra

Atlas 1.1 zu Atlas 1.2: Was sich verbessert hat

Atlas 1.2 ist ein neues Modell, kein Update der Bewertungsregeln. Es rechnet pro erzeugtem Token rund fünfmal so viel wie Atlas 1.1. Auf öffentlichen Standard-Benchmarks, für beide Versionen unter identischen Bedingungen unabhängig gemessen, sieht der Sprung so aus:

BenchmarkWas er misstAtlas 1.1Atlas 1.2
Long-Context ReasoningSchlussfolgern über lange Dokumente52 %82 %
GDP.pdfFragen zu umfangreichen PDF-Dokumenten4 %16 %
Omniscience-IndexHalluzination (0 = ausgeglichen, negativ = rät zu oft)−49−10
GPQA DiamondFachfragen auf Expertenniveau (Herstellerangabe)80 %89 %
Humanity's Last ExamSchwerste offene Fragen über alle Fachgebiete20 %34 %
GDPvalAufgaben aus der Wissensarbeit (Elo-Wertung)7451.463
Instruction FollowingAnweisungstreue, Format und Regeln84 %85 %

Drei dieser Werte entscheiden über die Qualität einer Qualifizierung.

Lange Vergabeunterlagen. Die Eignungskriterien stehen selten auf Seite 1. Häufig liegen sie in Anlage 7 auf Seite 180, formuliert als Verweis auf eine Norm und eine Mindestreferenz. Long-Context Reasoning misst genau das: Findet und verknüpft das Modell Informationen, die weit auseinander in einem langen Text liegen? Atlas 1.1 lag bei 52 Prozent, Atlas 1.2 bei 82 Prozent. In der Praxis heißt das: weniger übersehene Ausschlusskriterien und weniger Ausschreibungen, die im Score gut aussehen und beim Lesen durchfallen.

Weniger geratene Antworten. Der Omniscience-Index belohnt richtige Antworten und bestraft falsche stärker als ein ehrliches "unbekannt". Ein Wert von 0 bedeutet, dass ein Modell genauso oft richtig liegt wie es falsch rät. Atlas 1.1 lag bei −49, Atlas 1.2 bei −10. Ein erfundenes Eignungskriterium kostet mehr als ein fehlendes, weil es eine passende Ausschreibung aus Ihrer Pipeline wirft. Atlas 1.2 schreibt in solchen Fällen "in den Unterlagen nicht enthalten", statt eine Angabe zu erfinden.

Gleiche Steuerbarkeit. Die Anweisungstreue hat sich kaum bewegt. Das ist gewollt. Atlas 1.2 hält sich an dieselben Bewertungsregeln und dasselbe Ausgabeformat wie Atlas 1.1. Ihre Scores bleiben auf derselben Skala, Ihre Filter und Benachrichtigungen funktionieren unverändert.

Atlas 1.2 im Vergleich zum Markt

Die interessantere Frage ist nicht, ob Atlas 1.2 besser ist als Atlas 1.1, sondern wie es gegen die Modelle abschneidet, die man alternativ für die Qualifizierung einsetzen könnte. Wir haben die drei Größen nebeneinandergelegt, die dafür zählen: Wie gut liest ein Modell lange Dokumente, wie schnell erzeugt es seine Bewertung, und wie lange dauert es bis zur ersten Antwort.

ModellLong-Context ReasoningAusgabe (Tokens/s)Zeit bis zur ersten Antwort
Atlas 1.282 %ca. 1.500ca. 1,5 s
GPT-6 Astra81 %60321 s
GPT-5.6 Sol84 %58135 s
Claude Opus 579 %5248 s
Claude Sonnet 582 %76212 s
GPT-5.6 Luna84 %117124 s
Gemini 3.8 Flash81 %27813 s
DeepSeek V4 Flash80 %2131,2 s
Claude Haiku 4.550 %770,7 s
Mistral Large 336 %741,1 s
Atlas 1.152 %ca. 1.7000,3 s

Alle Fremdwerte sind unabhängige Messungen auf der jeweils höchsten Reasoning-Stufe, Stand September 2026.

Alle Fremdwerte sind unabhängige Messungen auf der jeweils höchsten Reasoning-Stufe, Stand September 2026.

Streudiagramm Lesequalität gegen Tokens pro Sekunde für elf Modelle. Atlas 1.2 steht allein oben rechts: 82 Prozent Lesequalität bei 1.500 Tokens pro Sekunde. Die Frontier-Modelle liegen bei 79 bis 84 Prozent, aber 50 bis 280 Tokens pro Sekunde.
Streudiagramm Lesequalität gegen Tokens pro Sekunde für elf Modelle. Atlas 1.2 steht allein oben rechts: 82 Prozent Lesequalität bei 1.500 Tokens pro Sekunde. Die Frontier-Modelle liegen bei 79 bis 84 Prozent, aber 50 bis 280 Tokens pro Sekunde.

Die Tabelle zeigt das Muster, das den Markt bestimmt. Die Modelle in der oberen Hälfte lesen lange Dokumente gut, liefern aber 50 bis 120 Tokens pro Sekunde und brauchen bis zur ersten Antwort zwischen einer und fünf Minuten. Die Modelle in der unteren Hälfte antworten schnell, verlieren aber beim Lesen ein Drittel bis die Hälfte der Informationen. Gemini 3.8 Flash und DeepSeek V4 Flash sind die einzigen, die beides annähernd verbinden, und liegen bei der Ausgabe trotzdem um den Faktor 5 bis 7 hinter Atlas 1.2.

Kein Modell am Markt kombiniert Lesequalität auf Frontier-Niveau mit 1.500 Tokens pro Sekunde. Das ist der Unterschied, für den wir Atlas betreiben.

Was 1.500 Tokens pro Sekunde in der Praxis bedeuten

Eine Qualifizierung braucht rund 2.000 Tokens Denk- und Ausgabearbeit: Lesen der Unterlagen gegen das Firmenprofil, Score, Begründung, gefundene Kriterien mit Fundstelle. Rechnet man das auf ein Firmenprofil hoch, das gegen 10.000 Ausschreibungen neu bewertet wird, ergibt sich auf einem einzigen Verarbeitungsstrang:

ModellAusgabe (Tokens/s)Dauer für 10.000 BewertungenFaktor zu Atlas 1.2
Atlas 1.2ca. 1.5003,7 Stunden1
Gemini 3.8 Flash27820 Stunden5,4
DeepSeek V4 Flash21326 Stunden7,0
GPT-5.6 Luna11747 Stunden (2 Tage)12,8
Claude Sonnet 57673 Stunden (3 Tage)19,7
GPT-6 Astra6093 Stunden (3,9 Tage)25,0
GPT-5.6 Sol5896 Stunden (4 Tage)25,9
Claude Opus 552107 Stunden (4,5 Tage)28,8

Annahme: 2.000 Tokens Denk- und Ausgabearbeit je Bewertung, ein Verarbeitungsstrang.

Balkendiagramm: Dauer für 10.000 Qualifizierungen auf einem Verarbeitungsstrang. Atlas 1.2 3,7 Stunden, Gemini 3.8 Flash 20 Stunden, DeepSeek V4 Flash 26 Stunden, GPT-5.6 Luna 47 Stunden, Claude Sonnet 5 73 Stunden, GPT-6 Astra 93 Stunden, GPT-5.6 Sol 96 Stunden, Claude Opus 5 107 Stunden
Balkendiagramm: Dauer für 10.000 Qualifizierungen auf einem Verarbeitungsstrang. Atlas 1.2 3,7 Stunden, Gemini 3.8 Flash 20 Stunden, DeepSeek V4 Flash 26 Stunden, GPT-5.6 Luna 47 Stunden, Claude Sonnet 5 73 Stunden, GPT-6 Astra 93 Stunden, GPT-5.6 Sol 96 Stunden, Claude Opus 5 107 Stunden

Zur Geschwindigkeit kommt der Preis. Zu Listenpreisen kostet dieselbe Neubewertung bei den großen Modellen zwischen 280 und 1.400 US-Dollar, je Profil und je Durchlauf. Für einen Kunden mit fünf Firmenprofilen und wöchentlicher Neubewertung wären das mit GPT-6 Astra über 350.000 US-Dollar im Jahr.

ModellPreis je 1 Mio. Tokens (Eingabe / Ausgabe)Kosten für 10.000 Bewertungen
Atlas 1.2in Bidpoint.ai enthaltenin Bidpoint.ai enthalten
GPT-6 Astra10 / 50 US-Dollarca. 1.400 US-Dollar
Claude Opus 55 / 25 US-Dollarca. 700 US-Dollar
GPT-5.6 Sol4 / 20 US-Dollarca. 560 US-Dollar
Claude Sonnet 52 / 10 US-Dollarca. 280 US-Dollar
Gemini 3.8 Flash0,75 / 3,75 US-Dollarca. 105 US-Dollar

Annahme je Bewertung: 4.000 Tokens Eingabe (Unterlagen und Firmenprofil), 2.000 Tokens Denk- und Ausgabearbeit. Listenpreise Stand September 2026.

Annahme je Bewertung: 4.000 Tokens Eingabe (Unterlagen und Firmenprofil), 2.000 Tokens Denk- und Ausgabearbeit. Listenpreise Stand September 2026.

Für Sie hat das zwei konkrete Folgen. Erstens: Wenn Sie Ihr Firmenprofil ändern, etwa eine neue Kernleistung ergänzen oder eine Region ausschließen, ist Ihre Pipeline innerhalb von Stunden neu sortiert, nicht Ende der Woche. Zweitens: Neue Ausschreibungen aus knapp 90 Portalen sind bewertet, bevor Ihr Arbeitstag beginnt.

Was das für Ihre Arbeit bedeutet

Sie müssen nichts umstellen. Atlas 1.2 ist seit heute für alle Kunden aktiv. Drei Dinge werden Sie bemerken:

  1. Scores verschieben sich leicht. Einzelne Ausschreibungen, die bisher bei 70 lagen, stehen jetzt bei 55, weil Atlas 1.2 ein Ausschlusskriterium in einer Anlage gefunden hat. Das ist beabsichtigt.
  2. Begründungen werden konkreter. Statt "Referenzen gefordert" steht dort "drei vergleichbare Referenzen der letzten fünf Jahre, Anlage 4, Abschnitt 2.3".
  3. Weniger falsche Ausschlüsse. Wenn eine Angabe in den Unterlagen fehlt, sagt Atlas 1.2 das und wertet die Ausschreibung nicht ab.

Wo Atlas 1.2 nicht vorn liegt

Ein Benchmark-Vergleich, der nur die gewonnenen Zeilen zeigt, ist Werbung. Deshalb auch die anderen: Bei Weltwissen und Fachfragen über alle Disziplinen (Humanity's Last Exam) liegt GPT-6 Astra mit 55 Prozent vor Atlas 1.2 mit 34 Prozent. Beim Omniscience-Index erreichen Astra und Claude Opus 5 positive Werte, Atlas 1.2 liegt bei −10. Bei Physik-Aufgaben und agentischer Software-Entwicklung ist der Abstand noch größer.

Halluzinationsindex im Marktvergleich: GPT-6 Astra +43, Claude Opus 5 +37, Gemini 3.8 Flash +30, GPT-5.6 Sol +22, Claude Sonnet 5 +16, Claude Haiku 4.5 −8, Atlas 1.2 −10, GPT-5.6 Luna −10, DeepSeek V4 Flash −14, Mistral Large 3 −40, Atlas 1.1 −49
Halluzinationsindex im Marktvergleich: GPT-6 Astra +43, Claude Opus 5 +37, Gemini 3.8 Flash +30, GPT-5.6 Sol +22, Claude Sonnet 5 +16, Claude Haiku 4.5 −8, Atlas 1.2 −10, GPT-5.6 Luna −10, DeepSeek V4 Flash −14, Mistral Large 3 −40, Atlas 1.1 −49

Für die Qualifizierung von Ausschreibungen spielt das keine Rolle. Atlas soll nicht wissen, was in der Welt ist, sondern was in den Unterlagen steht. Dort, beim Lesen langer Dokumente, liegt es gleichauf mit den größten Modellen. Ob eine Ausschreibung zu Ihrem Unternehmen passt, entscheidet weiterhin Ihr Team. Atlas bereitet die Go/No-Go-Entscheidung vor, es trifft sie nicht.

Fazit

Atlas 1.2 verbessert die zwei Eigenschaften, die bei der Qualifizierung von Ausschreibungen zählen: Es liest lange Vergabeunterlagen so zuverlässig wie GPT-6 Astra und Claude Sonnet 5 (82 Prozent im Long-Context-Benchmark) und rät deutlich seltener als sein Vorgänger (Omniscience-Index von −49 auf −10). Dabei antwortet es mit rund 1.500 Tokens pro Sekunde, 25-mal schneller als GPT-6 Astra und 5-mal schneller als das schnellste Frontier-Modell am Markt.

Wenn Sie sehen möchten, wie Atlas 1.2 Ihre Ausschreibungen bewertet, vereinbaren Sie eine Demo. Sie bringen Ihr Firmenprofil mit, wir zeigen Ihnen die Qualifizierung an echten Vergaben aus Ihrem Segment.

Text generiert mit Liebe und KI.
Continue reading