Wie können Roboter lernen, die zukünftige 3D-Welt allein auf Basis visueller Informationen zu verstehen und vorherzusagen? World Models entwickeln sich zu einem wichtigen Paradigma in der Robotik und ermöglichen intelligenten Systemen, zu schlussfolgern, wie sich ihre Umgebung über die Zeit verändert. Diese Fähigkeit ist insbesondere für dynamische Robotikanwendungen wie autonome Fahrzeuge von großer Bedeutung, bei denen die Vorhersage zukünftiger Szenengeometrie, Semantik und Bewegung eine wichtige Grundlage für sichere Interaktion und Entscheidungsfindung darstellt. Semantic 4D Occupancy bietet hierfür eine strukturierte Repräsentation der sich verändernden 3D-Welt, indem Geometrie, Semantik und Dynamik einer Szene gemeinsam modelliert werden. Eine zentrale Herausforderung liegt jedoch in der benötigten Überprüfung: Aktuelle Occupancy-Modelle stützen sich oft auf teure, aufwendige, dicht annotierte 3D-Voxel-Daten, die schwer zu beschaffen und zu skalieren sind. Im Rahmen dieser Masterarbeit untersuchst du, wie Bildverarbeitungs-Grundmodelle wie DINOv2, CLIP oder SAM als skalierbare semantische Lehrer für ein vision-centric Occupancy World Model eingesetzt werden können. Durch die Übertragung semantischen Wissens aus vortrainierten 2D-Modellen auf räumlich-zeitliche 3D-/4D-Repräsentationen soll die Abhängigkeit von dichten 3D-Annotationen reduziert werden, ohne dabei die Qualität der Vorhersage zukünftiger Szenen zu beeinträchtigen. Du entwickelst und evaluierst ein durch Grundmodelle unterstütztes Predictive Occupancy World Model auf Basis von Multi-View-Kamerasequenzen. Dabei untersuchst du insbesondere Ansätze zum Semantic Feature Alignment und zur Knowledge Distillation, mit dem Ziel, skalierbare 4D-Occupancy-Vorhersagen für dynamische Robotikumgebungen wie das autonome Fahren zu ermöglichen.
Diese Aufgaben interessieren Dich
Entwicklung eines visionszentrierten Occupancy Worl Models auf Basis von Transformer-Architekturen zur Vorhersage zukünftiger semantischer 4D-Occupancy aus sequenziellen Multi-View-Kamera-Eingaben.
Aufbau und Training der Pipelines mit PyTorch, Entwicklung von Alignment-Mechanismen zur Destillation semantischer Merkmale aus 2D-Grundmodellen in deine 4D-raum-zeitliche Weltdarstellung.
Durchführung von Benchmarks anhand voll überwachter Basismodelle auf groß angelegten Datensätzen (z. B. nuScenes), mit Fokus auf Prognosegenauigkeit (IoU), semantische Präzision und Label-Effizienz.
Das zeichnet Dich aus
Du bist eingeschrieben in einem Masterstudium der Informatik, Künstlichen Intelligenz, Robotik oder eines vergleichbaren Studiengangs.
Du verfügst über sehr gute Programmierkenntnisse in Python sowie fundierte Erfahrung mit Deep-Learning-Frameworks (insbesondere PyTorch).
Du bringst fundiertes Hintergrundwissen im Bereich 3D Computer Vision mit. Praktische Erfahrung mit semantischer Segmentierung, Occupancy Networks oder 3D Gaussian Splatting ist von großem Vorteil.
Du besitzt Kenntnisse über Vision Transformers(ViT), Foundation Models (DINO, CLIP) sowie Paradigmen des selbst- bzw. schwach überwachten Lernens (Self-/Weakly-Supervised Learning).
Du hast eine selbstständige und lösungsorientierte Arbeitsweise, hohe Motivation sowie sehr gute Englisch- und Deutschkenntnisse (C1-Niveau) für eine klare Kommunikation im Team und mit unseren Partnern.
Das bieten wir Dir
New Work & Kultur
Selbstorganisierte Teams mit viel Gestaltungsspielraum
Verantwortung und Mitgestaltung
Offene Fehler- und Feedbackkultur
Mentoring & persönliche Entwicklung
Individuelles Mentoring ab dem ersten Tag
Regelmäßige Entwicklungsgespräche („Catch-ups“)
Führung auf Augenhöhe, basierend auf Vertrauen und Respekt
Lebenslanges Lernen
Fachliche und überfachliche Trainings
Interne TechTalks, externe Fortbildungen und Konferenzen
High-End Software Engineering
Anspruchsvolle, innovative und vielseitige Projekte
Cross-funktionale Teams mit modernen Technologien
Gelebte Expertenkultur und teamübergreifender Wissensaustausch
Familienfreundlichkeit
Zuschuss zu Betreuungskosten bis zu 250 €/Kind
Lohnfortzahlung für Kinderkrankentage
Gemeinschaft & Events
Regelmäßige Events (z. B. Retreats, Sommerfeste)
Persönliche Begegnungen & Teamzusammenhalt
Ab Tag 1 Teil der vielfältig vernetzten Community
Arbeitszeit & Flexibilität
Freie Wahl von Arbeitszeit und -ort
Flexible Arbeitszeitkonten, 30 Tage Urlaub, Teilzeitoption, Sabbatical & Workation
Gesundheit & Wohlbefinden
Mental Health Taskforce
JobRad & weitere Angebote
Vielfalt & Inklusion
Diversity Taskforce für Perspektivenvielfalt
Kultur der Zugehörigkeit: Jede*r soll sich angenommen fühlen