Was seit dem 22. September neu ist
OpenAI führt Sol und Luna als neue Reasoning-Modelle für Work und Codex sowie als API-Modelle. Die API verarbeitet Text und Bilder als Eingabe und erzeugt Text. Welche Auswahl ein Mitarbeiter tatsächlich sieht, hängt vom Tarif, der Oberfläche und den Vorgaben des Workspace ab. Ein Screenshot aus einem anderen Konto ist deshalb kein Einführungsnachweis. Dokumentieren Sie im Pilot das verwendete Konto, die Modellkennung und die Denkstufe. In Codex Desktop bleibt eine manuell gewählte Modellauswahl erhalten. Kontrollieren Sie daher bestehende Aufgaben ausdrücklich; die Installation eines Updates bedeutet nicht, dass jede Aufgabe bereits mit dem neuen Modell läuft.
Drei Aufgaben statt eines pauschalen Siegers
Stellen Sie einen kleinen Aufgabenmix zusammen: eine klar strukturierte Zuordnung, eine Auswertung widersprüchlicher Unterlagen und eine Änderung an einem internen Werkzeug. Für die Zuordnung zählt zunächst, ob Kategorien vollständig und reproduzierbar ausgegeben werden. Bei der Auswertung prüfen Sie belegte Aussagen und fehlende Informationen. Beim Werkzeug zählen funktionierendes Verhalten und verständliche Änderungen. Lassen Sie dieselben Eingaben mit derselben Anweisung bearbeiten. Beginnen Sie mit der voreingestellten Denkstufe und erhöhen Sie sie nur bei einem erkennbaren Qualitätsproblem. So finden Sie heraus, welche Modellkonfiguration eine konkrete Arbeit trägt, anstatt Fähigkeiten aus einem Modellnamen abzuleiten.
Praxisbeispiel: Angebotsanfragen vorbereiten
Ein technischer Dienstleister könnte neue Anfragen zunächst in Leistungsarten einordnen und Pflichtangaben extrahieren lassen. Ein zweiter Schritt vergleicht die Anforderungen mit einer freigegebenen Leistungsbeschreibung und erstellt Rückfragen. Das ist ein illustratives Vorgehen, kein behaupteter Kundenfall. Legen Sie vorab fest, welche Angaben fehlen dürfen und wann eine Anfrage an einen Menschen geht. Testen Sie insbesondere unklare Termine, widersprüchliche Mengen und nicht angebotene Leistungen. Der Entwurf darf keine Preise oder Zusagen erfinden. Erst wenn die günstigere Konfiguration dieselben Abnahmekriterien erfüllt, lohnt sich ihre Verwendung für den ersten Schritt; anspruchsvollere Fälle können getrennt bewertet werden.
API-Preis und fertiges Ergebnis auseinanderhalten
Der geprüfte API-Stand nennt für Standardanfragen bis 272.000 Eingabetoken je Million Token bei Sol 2 US-Dollar Eingabe, 0,20 US-Dollar zwischengespeicherte Eingabe und 10 US-Dollar Ausgabe; bei Luna 0,10, 0,01 und 0,50 US-Dollar. Das sind Anbieterpreise mit Stand 23. September, keine ChatGPT-Abopreise und kein Angebot von Werkverstand. Längere Prompts, weitere Verarbeitungsklassen und Werkzeuge müssen gesondert geprüft werden. Rechnen Sie im Pilot zusätzlich Wiederholungen und menschliche Korrekturzeit ein. Eine kompakte Extraktion kann wirtschaftlich anders aussehen als eine lange Analyse mit mehreren Werkzeugaufrufen. Vergleichen Sie deshalb Kosten je fachlich freigegebenem Ergebnis.
So wird aus dem Test eine Teamentscheidung
Nutzen Sie einen festen Satz bereits abgeschlossener Fälle mit bekannten Ergebnissen. Entfernen Sie unnötige personenbezogene Daten und halten Sie die Eingaben während des Vergleichs gleich. Bewerten Sie Vollständigkeit, Quellenbezug, Format, Bearbeitungsdauer und Nacharbeit getrennt. Eine falsche Kunden- oder Auftragszuordnung ist ein harter Fehler und darf nicht durch gute Durchschnittswerte verschwinden. Halten Sie außerdem fest, wer Modelleinstellungen ändern darf und welche Aufgaben bei einem Limit pausieren. Nach einem erfolgreichen Pilot wird zunächst nur ein Workflow umgestellt. Prüfen Sie die ersten produktiven Ergebnisse engmaschig und behalten Sie einen manuellen Weg, wenn Zugang, Qualität oder Kosten vom Test abweichen.
Häufige Fragen zur Einführung
Müssen alle Aufgaben sofort umgestellt werden? Nein. Eine neue Modellgeneration ist ein Anlass zur Prüfung; bestehende funktionierende Abläufe brauchen einen belegbaren Grund für den Wechsel. Ist Luna automatisch die beste Wahl für einfache Arbeit? Auch einfache Aufgaben können hohe Fehlerfolgen haben, etwa bei Auftragsnummern oder personenbezogenen Datensätzen. Ist ein API-Zugang im ChatGPT-Tarif enthalten? Abrechnung und Zugangsweg sind getrennt zu behandeln. Welche Kennzahl entscheidet? Für einen konkreten Workflow zählt der Anteil korrekt abgeschlossener Fälle bei tragbaren Gesamtkosten. Wenn Sie noch keinen geeigneten Vergleichsfall haben, hilft der KI-Systemcheck zunächst dabei, eine begrenzte Aufgabe mit einem klar prüfbaren Ergebnis auszuwählen.
Nachvollziehbar bleiben
Primärquellen
- OpenAI: GPT-6 Sol modelQuellenstand:
- OpenAI: GPT-6 Luna modelQuellenstand:
- OpenAI: Work and Codex modelsQuellenstand:
- OpenAI: API changelogQuellenstand:



