TripoSR: Fast 3D Object Reconstruction from a Single Image
TripoSR の公式技術レポートです。Transformer ベースのフィードフォワードモデルで、単一の画像から 0.5 秒未満で 3D Mesh を再構成します。2024 年 3 月に arXiv で公開され、Stability AI と Tripo AI の共同研究として MIT ライセンス でリリースされました。
- 著者
- Dmitry Tochilkin, David Pankratz, Zexiang Liu, Zixuan Huang, Adam Letts, Yangguang Li, Ding Liang, Christian Laforte, Varun Jampani, Yan-Pei Cao
- 公開日
- 2024 年 3 月 4 日(arXiv)
- arXiv ID
- 2403.02151
- 分野
- Computer Vision and Pattern Recognition (cs.CV)
- ライセンス
- MIT
アブストラクト
TripoSR は Transformer アーキテクチャ を用いた 3D 再構成モデルで、高速なフィードフォワード 3D 生成を実現し、単一の画像から 0.5 秒未満で 3D Mesh を生成します。LRM のネットワークアーキテクチャを基盤とし、データ処理、モデル設計、学習手法に大幅な改良を加えています。公開データセットにおいて、定量的にも定性的にも他のオープンソースの代替手法を上回ります。研究者、開発者、クリエイターが最新の 3D 生成 AI を利用できるよう、MIT ライセンスでリリースされています。
主な貢献
単一画像から 0.5 秒未満で 3D へ
フィードフォワード推論により、GPU 上で 1 枚の画像から 1 秒未満で完全な 3D Mesh を生成します。オブジェクトごとの最適化は不要です。
LRM を基盤とした Transformer アーキテクチャ
Large Reconstruction Model(LRM)の設計を拡張し、データ処理、モデル設計、学習に大幅な改良を加えています。
オープンソース、MIT ライセンス
コードと学習済みの重みは、寛容な MIT ライセンスでリリースされ、研究用途にも商用利用にも無償で使えます。
オープンモデルの中で最先端
公開ベンチマークにおいて、定量的にも定性的にも他のオープンソースの単一画像再構成手法を上回ります。
著者
TripoSR は Stability AI と Tripo AI の共同研究です。技術レポートには 10 名の著者が記載されています。
- Dmitry Tochilkin
- David Pankratz
- Zexiang Liu
- Zixuan Huang
- Adam Letts
- Yangguang Li
- Ding Liang
- Christian Laforte
- Varun Jampani
- Yan-Pei Cao
引用方法
学術研究で TripoSR を引用するには、次の BibTeX エントリをご利用ください。
@article{TripoSR2024,
title={TripoSR: Fast 3D Object Reconstruction from a Single Image},
author={Tochilkin, Dmitry and Pankratz, David and Liu, Zexiang and Huang, Zixuan and Letts, Adam and Li, Yangguang and Liang, Ding and Laforte, Christian and Jampani, Varun and Cao, Yan-Pei},
journal={arXiv preprint arXiv:2403.02151},
year={2024}
}