TripoSR: Fast 3D Object Reconstruction from a Single Image
Der offizielle technische Bericht hinter TripoSR: ein Transformer-basiertes Feed-Forward-Modell, das in unter 0,5 Sekunden ein 3D-Mesh aus einem einzelnen Bild rekonstruiert. Im März 2024 auf arXiv veröffentlicht und unter der MIT-Lizenz als Zusammenarbeit zwischen Stability AI und Tripo AI freigegeben.
- Autoren
- Dmitry Tochilkin, David Pankratz, Zexiang Liu, Zixuan Huang, Adam Letts, Yangguang Li, Ding Liang, Christian Laforte, Varun Jampani, Yan-Pei Cao
- Veröffentlicht
- 4. März 2024 (arXiv)
- arXiv-ID
- 2403.02151
- Fachgebiet
- Computer Vision and Pattern Recognition (cs.CV)
- Lizenz
- MIT
Zusammenfassung
TripoSR ist ein 3D-Rekonstruktionsmodell, das eine Transformer-Architektur für die schnelle Feed-Forward-3D-Generierung nutzt und in unter 0,5 Sekunden ein 3D-Mesh aus einem einzelnen Bild erzeugt. Es baut auf der LRM-Netzwerkarchitektur auf und ergänzt sie um wesentliche Verbesserungen bei der Datenverarbeitung, beim Modelldesign und bei den Trainingsmethoden. Auf öffentlichen Datensätzen übertrifft es andere Open-Source-Alternativen, sowohl quantitativ als auch qualitativ. Es wird unter der MIT-Lizenz freigegeben, um Forschenden, Entwickelnden und Kreativen Zugang zu aktueller generativer 3D-KI zu geben.
Wichtigste Beiträge
Vom einzelnen Bild zu 3D in unter 0,5 s
Die Feed-Forward-Inferenz erzeugt auf einer GPU in deutlich unter einer Sekunde ein vollständiges 3D-Mesh aus einem Bild, ganz ohne Optimierung pro Objekt.
Transformer-Architektur auf Basis von LRM
Erweitert das Design des Large Reconstruction Model (LRM) um wesentliche Verbesserungen bei Datenverarbeitung, Modelldesign und Training.
Open Source, unter MIT-Lizenz
Code und vortrainierte Gewichte werden unter der freizügigen MIT-Lizenz veröffentlicht, kostenlos für Forschung und kommerzielle Nutzung.
State of the Art unter den offenen Modellen
Übertrifft andere Open-Source-Methoden zur Rekonstruktion aus einem einzelnen Bild auf öffentlichen Benchmarks, sowohl quantitativ als auch qualitativ.
Autoren
TripoSR ist eine Zusammenarbeit zwischen Stability AI und Tripo AI. Der technische Bericht nennt zehn Autoren:
- Dmitry Tochilkin
- David Pankratz
- Zexiang Liu
- Zixuan Huang
- Adam Letts
- Yangguang Li
- Ding Liang
- Christian Laforte
- Varun Jampani
- Yan-Pei Cao
Zitierweise
Verwende den folgenden BibTeX-Eintrag, um TripoSR in wissenschaftlichen Arbeiten zu zitieren:
@article{TripoSR2024,
title={TripoSR: Fast 3D Object Reconstruction from a Single Image},
author={Tochilkin, Dmitry and Pankratz, David and Liu, Zexiang and Huang, Zixuan and Letts, Adam and Li, Yangguang and Liang, Ding and Laforte, Christian and Jampani, Varun and Cao, Yan-Pei},
journal={arXiv preprint arXiv:2403.02151},
year={2024}
}Paper-Ressourcen
arXiv-Abstract-Seite
Der vollständige technische Bericht, die Zusammenfassung und die Autorenliste auf arXiv (2403.02151), mit PDF und Zitations-Export.
Quellcode auf GitHub
Die offizielle, unter MIT-Lizenz stehende Implementierung unter VAST-AI-Research/TripoSR, inklusive run.py und Beispielbildern.
Modell auf Hugging Face
Die vortrainierten TripoSR-Gewichte und die Modellkarte unter stabilityai/TripoSR, bereit zum Laden für die Inferenz.
FAQ zum TripoSR-Paper
Das Paper in Aktion erleben
TripoSR verwandelt ein einzelnes Bild in unter einer Sekunde in ein 3D-Modell. Probier es kostenlos im Browser, ganz ohne Installation.
