Ich bin Jay Derinbogaz. Ich habe drei Unternehmen gegründet und habe große Sprachmodelle drei Jahre bevor ChatGPT daraus einen Jobtitel machte in Produktion gebracht.
Ich war schon vor der API hier
November 2022 ist der Zeitpunkt, an dem die meisten Menschen ein Sprachmodell kennengelernt haben. Ich habe seit 2019 darauf Produkte ausgeliefert.
OpenAI hat die GPT-2-Veröffentlichung über das Jahr verteilt, weil sie das vollständige Modell mit 1,5 Milliarden Parametern als zu gefährlich für die Veröffentlichung einstuften. Ich habe die Checkpoints feinabgestimmt, sobald sie erschienen. Kein Chat-Endpoint und niemand, bei dem man ein Ticket einreichen konnte. Man scrapete sich seinen eigenen Datensatz, trainierte selbst und brachte das Modell auf Hardware unter, die nie dafür ausgelegt war.
NameKrea ist daraus entstanden. GPT-2 355M, feinabgestimmt auf 100.000 Domains, die ich aus dem Majestic Million gescrapet und mit der Meta-Beschreibung dessen, was jede Seite tatsächlich war, gepaart habe, sodass es Namen generierte, die etwas bedeuteten, statt Rauschen zu sein. Dreißig Minuten Training auf zwei GPUs. Es wurde als Live-Produkt veröffentlicht, ist MIT-lizenziert, und Leute forken es noch Jahre später.
Jedes bedeutende Open-Release dieser Ära lief über meine GPUs: gpt-2-simple, finetune-gpt2xl, aitextgen auf Multi-GPU-SageMaker, dann GPT-J 6B auf Consumer-VRAM. Ich habe das vollständige 1.5B GPT-2 XL auf einer einzigen 16-GB-Karte zum Laufen gebracht, als die allgemein akzeptierte Antwort war, dass das nicht geht. Das war damals die ganze Disziplin: Die Modelle waren kostenlos und die Rechenleistung war die Wand, also bestand die gesamte Ingenieursarbeit darin, wie man um die Wand herumkam.
Die Branche gibt heute Milliarden für dieselbe Frage aus, die ich 2019 in einem Schlafzimmer beantwortet habe. Was braucht es, um dieses Ding auf Hardware in Produktion zu bringen, die man sich tatsächlich leisten kann?
TextCortex
Ich habe TextCortex 2021 in Berlin mitgegründet und bin der technische Gründer. Wir bauen KI-Agenten für Unternehmen, die sich darum kümmern müssen, wo ihre Daten leben. Europäische Infrastruktur, echte Governance, eingesetzt bei Unternehmen wie Siemens und Lamborghini.
Unterstützt von b2venture, Speedinvest und Entrepreneur First. Über zwei Millionen Nutzer. Von Gartner, G2 und Capterra als Kategorieführer ausgezeichnet, #20 der am schnellsten wachsenden Produkte 2024 und #10 der besten KI-Software 2025.
Ich lese immer noch die Diffs. Das meiste, was ich heute baue, ist das Tooling um die Modelle herum, eher als die Modelle selbst, und beide meiner aktuellen Open-Source-Projekte sind direkt aus Problemen entstanden, auf die wir beim Engineering in großem Maßstab gestoßen sind.
Juror lässt mehrere Frontier-Modelle parallel über denselben Pull Request laufen, denn ein Reviewer bedeutet genau einen blinden Fleck, und dessen Form lernt man von innen nie kennen.
GitRank löst die andere Hälfte. Es bewertet jeden gemergten Pull Request mit Claude, klassifiziert die Arbeit nach Komponente und Schweregrad und gewichtet einen P1-Authentifizierungs-Fix anders als eine Textänderung, und verwandelt das dann in Leaderboards, Velocity-Metriken, Bug-Hotspots, Feature-Ownership und Erkennung von Wissenssilos. Engineering-Performance-Reviews basieren immer noch größtenteils auf Bauchgefühl, und die Daten, um es richtig zu machen, lagen die ganze Zeit in der Git-Historie von jedem. Selbst hostbar, EU-Infrastruktur, kostenlos für nicht-kommerzielle Nutzung.
Drei Unternehmen
TextCortex ist das dritte.
Mit 22 habe ich ein AR/VR-Unternehmen gegründet, das für Renault und Nokia gebaut hat. Mit 24 habe ich Grafentek in Deutschland gegründet, um Graphen-Batteriematerialien herzustellen. Deep Tech, harte Wissenschaft, und die deutsche Wirtschaftspresse hat ein Buchkapitel darüber veröffentlicht. Dazwischen habe ich Data Engineering bei trivago geleitet.
Ich habe Maschinenbau mit Schwerpunkt Computer-Mechanik studiert: numerische Methoden auf sehr großen Matrizen, was ein viel kürzerer Weg zum Training neuronaler Netze ist, als es klingt. Ich bin über Graphen und Virtual Reality zu Sprachmodellen gekommen, und in jedem dieser Bereiche war der schwierige Teil nie die Demo.
Was du hier findest
Build-Logs und Belege. Ich veröffentliche, was es gekostet hat und was es verfehlt hat, weil das in dieser Branche fast niemand tut und die Rechnung meist das gesamte Argument ist.
Über diese Seite
Statisches Astro, deployed auf Cloudflare Workers. Beiträge sind Markdown-Dateien in einem Git-Repo. Jeder Beitrag wird von einer GitHub Action in acht weitere Sprachen übersetzt, einschließlich des URL-Slugs. Diese Übersetzungen sind maschinell erzeugt und entsprechend gekennzeichnet.
Die GitHub- und LinkedIn-Links in der Seitenleiste sind der schnellste Weg, mich zu erreichen.