- AutorIn
- M.Sc. Julian Bruno Heiligenthal
- Titel
- Extending CNNs for Indoor Scene Reconstruction Supported by Omnidirectional Stereo Cameras
- Zitierfähige Url:
- https://nbn-resolving.org/urn:nbn:de:bsz:ch1-qucosa2-1062174
- Erstveröffentlichung
- 2026
- Datum der Einreichung
- 12.05.2025
- Datum der Verteidigung
- 15.06.2026
- DOI
- https://doi.org/10.60687/2026-0151
- Abstract (DE)
- Eine dreidimensionale Erfassung der Umgebung liefert wertvolle Informationen für viele Anwendungsfelder. So ist beispielsweise im Bereich des autonomen Fahrens eine präzise Tiefenschätzung unerlässlich. Mit Hilfe der Tiefenschätzung können überholende Fahrzeuge erkannt sowie Personen und Hindernisse auf der Straße lokalisiert werden, um Kollisionen zu vermeiden. Auch außerhalb des Straßenverkehrs spielen räumliche Umgebungsrekonstruktionen eine wichtige Rolle. Sogenannte autonome mobile Roboter (AMRs), welche in modernen Lagerhallen zum Einsatz kommen, rekonstruieren die Umgebung aus Sicherheitsgründen und zur Navigation. Darüber hinaus stellt Ambient Assisted Living ein weiteres Anwendungsfeld dar, welches von 3D Rekonstruktionen profitieren kann. Dieses Feld befasst sich mit der Unterstützung von pflegebedürftigen Menschen in ihrem Alltagsleben. Hier kann die räumliche Erfassung der Szene dazu beitragen, ein Bewegungsprofil älterer Menschen für das Pflegepersonal zu erstellen oder gar Stürze und andere Notfallsituationen zu erkennen. Die Technologien Stereo Vision und Multi-View Vision können dabei eingesetzt werden, um die dritte Dimension aus mindestens zwei Bildern zu rekonstruieren, welche zur selben Zeit aus unterschiedlichen Perspektiven aufgenommen wurden. Die meisten Ansätze konzentrieren sich dabei auf die Verarbeitung von perspektivischen Stereo-Bildern, die durch zwei horizontal angeordnete, handelsübliche Kameras erzeugt werden. Diese Bilder weisen allerdings ein sehr kleines Sichtfeld (engl. field of view, FOV) auf, was bedeutet, dass sie nur einen Bruchteil der Szene erfassen können. Hingegen schließen omnidirektionale Bilder, auch Fischaugenbilder genannt, ein sehr großes Sichtfeld von ca. 180° ein. Sofern omnidirektionale Kameras sorgfältig angebracht werden, können diese die komplette Szene erfassen und räumlich rekonstruieren. Mittlerweile haben Convolutional Neural Networks (CNNs) Einzug in das Feld der Stereo Vision gehalten. Dabei verarbeiten auch hier wieder die meisten Ansätze perspektivische Bilder, obgleich es einige wenige gibt, die die Umgebung mit Hilfe von omnidirektionalen Bildern präzise räumlich rekonstruieren können. Jedoch müssen bei diesen Methoden starke Verzerrungsartefakte berücksichtigt werden, die vor allem auf omnidirektionalen Bildern beobachtet werden können. CNNs, die omnidirektionale Stereo-Bilder verarbeiten, sind deshalb auch oft langsamer als Netze, welche sich auf perspektivische Bilder konzentrieren. Diese Dissertation beabsichtigt, die Lücke zwischen Rekonstruktionsgenauigkeit und hohen Durchsatzraten im Bereich der omnidirektionalen Szenenrekonstruktion zu schließen. Kern dieser Arbeit sind dabei OmniGlasses, welche zur Synthese omnidirektionaler Bilder verwendet werden können. OmniGlasses stellen flexible Suchtabellen dar, die an verschiedene Kameramodelle wie das equiangulare Kameramodell oder das ℳ9 -Kameramodell angepasst werden können. OmniGlasses transformieren dabei die Bilder einer Kamera so, als ob sie aus einer anderen Perspektive, die einer Referenzkamera, aufgenommen worden wären. Dies geschieht unter Annahme bestimmter Disparitätswinkel. Dabei ist ein Disparitätswinkel definiert als der Winkel zwischen zwei Lichtstrahlen, welche aus der Richtung eines bestimmten Objekts kommen und durch die beiden Kameras aufgenommen werden. Die Synthese mit der größten Übereinstimmung zwischen transformiertem Bild und dem Bild der Referenzkamera erlaubt es, Rückschlüsse auf den wahren Disparitätswinkel für jedes Pixel zu ziehen. Sobald dieser Disparitätswinkel ermittelt wurde, kann die Entfernung zum Objekt durch Triangulation bestimmt werden. Im Rahmen dieser Dissertation werden OmniGlasses in das Netz AnyNet integriert, das ursprünglich für perspektivische Bildpaare entwickelt wurde. Durch OmniGlasses rekonstruiert dieses Netz schnell und genau die Umgebung mittels omnidirektionaler Bilder. Das neu entwickelte Netz Omni-AnyNet wurde auf Basis des synthetisch generierten Datensatzes THEOStereo sowie auf Basis des Datensatzes Omni-Castles trainiert und evaluiert. Letzterer Datensatz weist reale Eigenschaften auf und wird im Rahmen dieser Dissertation erstmals vorgestellt. Beide Datensätze bestehen aus omnidirektionalen Bildern sowie deren Ground-Truth-Karten. Omni-AnyNet rekonstruiert erfolgreich die Umgebung mit einem durchschnittlichen absoluten Fehler von ca. 13 cm auf THEOStereo und ungefähr 14 cm auf Omni-Castles. Omni-AnyNet läuft auf modernen Grafikkarten mit 48.4 Bildpaaren pro Sekunde und ist somit echtzeitfähig. Aufgrund der Rekonstruktionsgenauigkeit und -geschwindigkeit kann Omni-AnyNet einen wichtigen Beitrag zu Anwendungen im Bereich Ambient Assisted Living leisten.
- Abstract (EN)
- A three-dimensional reconstruction of the environment provides valuable information for many fields of application. For instance, a precise depth estimation is inevitable for autonomous driving. With the help of depth estimation, overtaking cars can be recognized and persons or objects can be localized in order to avoid collisions. Spatial reconstructions play also a vital role outside street traffic. So-called autonomous mobile robots (AMRs) in modern warehouses reconstruct the environment in 3D for safety or navigation purposes. Ambient assisted living (AAL) constitutes another application area that can profit from a precise 3D reconstruction of the scene. This field addresses systems that support people in need of care in their daily life. A spatial reconstruction of scene and persons can be used to generate mobility profiles of elderly people for caregivers or even to detect falls and emergency situations. Stereo vision and multi-view vision denote technologies that retrieve the third dimension out of two or more images recorded at the same time from different views. Most approaches concentrate on perspective stereo images from pairs of horizontally aligned commodity cameras. These images, however, exhibit a very limited field of view (FOV), i.e., they capture only a fraction of the scene. In contrast, omnidirectional images, also known as fisheye images, have a large FOV of around 180°. If mounted carefully, two omnidirectional cameras can observe and spatially reconstruct the whole environment. Meanwhile convolutional neural networks (CNNs) reached the field of stereo vision. Most CNNs for scene reconstruction process perspective images but a few approaches can precisely reconstruct the scene from omnidirectional images. These networks, however, need to account for strong distortion artifacts that are present in this sort of images. Therefore, these CNNs are often slower than their competitors for perspective images. This dissertation aims to bridge the gap between accuracy and high throughput rates for omnidirectional scene reconstruction. This is accomplished by introducing OmniGlasses, which can be applied for an efficient omnidirectional view synthesis. In particular, OmniGlasses are a set of flexible lookup tables that can be tailored to different camera models such as the equiangular or the ℳ9 camera model. OmniGlasses transform the image of a camera to the view of another reference camera (view synthesis), while assuming a range of normalized disparity hypotheses. A normalized disparity is defined as the angle spanned by the two light rays that come from a certain object and that are captured by both cameras. The view synthesis with the highest coincidence of transformed image and the image of the reference camera indicates the correct disparity for each pixel. Once the disparity is estimated, the distance to the object can be retrieved by means of triangulation. In this work, OmniGlasses are incorporated into AnyNet, a network originally designed for perspective stereo vision, to form an accurate yet fast CNN for omnidirectional scene reconstruction. The new network Omni-AnyNet is trained and evaluated on THEOStereo, a synthetic dataset, as well as on Omni-Castles, a dataset with real-world properties, which is introduced in this dissertation. Both datasets consist of omnidirectional images as well as their ground truth maps. Omni-AnyNet successfully recovers a scene with a mean absolute error of around 13 cm on THEOStereo and 14 cm on Omni-Castles. Omni-AnyNet runs at 48.4 fps on modern GPUs and is therefore real-time capable. Due to low reconstruction errors and high frame rates, Omni-AnyNet can make a considerable contribute to applications in the field of ambient assisted living.
- Freie Schlagwörter (EN)
- epipolar geometry, fisheye, omnidirectional, lookup table, stereo vision, view synthesis, disparity, 3D scene reconstruction
- Klassifikation (DDC)
- 004
- 005
- 006
- 600
- 620
- Normschlagwörter (GND)
- Computervision, Bildverarbeitung, Maschinelles Sehen, Kamera, Stereokamera, 3D-Sensor, Epipolargeometrie, Fischauge <Objektiv>, Entfernungsmessung, Überwachung, Monitoring
- GutachterIn
- Prof. Dr.-Ing. Gangolf Hirtz
- Prof. Dr.-Ing. habil. Christian Riess
- BetreuerIn Hochschule / Universität
- Prof. Dr.-Ing. Gangolf Hirtz
- Den akademischen Grad verleihende / prüfende Institution
- Technische Universität Chemnitz, Chemnitz
- Version / Begutachtungsstatus
- angenommene Version / Postprint / Autorenversion
- URN Qucosa
- urn:nbn:de:bsz:ch1-qucosa2-1062174
- Veröffentlichungsdatum Qucosa
- 12.08.2026
- Dokumenttyp
- Dissertation
- Sprache des Dokumentes
- Englisch
- Lizenz / Rechtehinweis
CC BY 4.0