TripoSR: Fast 3D Object Reconstruction from a Single Image
TripoSR의 공식 기술 보고서입니다. Transformer 기반의 피드포워드 모델로, 단일 이미지로부터 0.5초 이내에 3D Mesh를 재구성해요. 2024년 3월 arXiv에 공개되었고, Stability AI와 Tripo AI의 협업으로 MIT 라이선스 아래 배포되었어요.
- 저자
- Dmitry Tochilkin, David Pankratz, Zexiang Liu, Zixuan Huang, Adam Letts, Yangguang Li, Ding Liang, Christian Laforte, Varun Jampani, Yan-Pei Cao
- 공개일
- 2024년 3월 4일 (arXiv)
- arXiv ID
- 2403.02151
- 분야
- Computer Vision and Pattern Recognition (cs.CV)
- 라이선스
- MIT
초록
TripoSR은 빠른 피드포워드 3D 생성을 위해 Transformer 아키텍처를 사용하는 3D 재구성 모델로, 단일 이미지로부터 0.5초 이내에 3D Mesh를 생성해요. LRM 네트워크 아키텍처를 기반으로 하며, 데이터 처리, 모델 설계, 학습 기법에서 상당한 개선을 더했어요. 공개 데이터셋에서 정량적으로도 정성적으로도 다른 오픈소스 대안들을 능가해요. 연구자, 개발자, 크리에이터가 최신 3D 생성형 AI에 접근할 수 있도록 MIT 라이선스로 배포되었어요.
핵심 기여
단일 이미지를 0.5초 이내에 3D로
피드포워드 추론으로 GPU에서 1초가 채 안 되는 시간에 하나의 이미지로부터 완전한 3D Mesh를 생성하며, 객체별 최적화가 필요 없어요.
LRM 기반 Transformer 아키텍처
Large Reconstruction Model(LRM) 설계를 확장해 데이터 처리, 모델 설계, 학습 방식을 크게 개선했어요.
오픈소스, MIT 라이선스
코드와 사전 학습된 가중치가 관대한 MIT 라이선스로 배포되어, 연구와 상업적 용도 모두 무료로 사용할 수 있어요.
오픈 모델 중 최고 수준
공개 벤치마크에서 다른 오픈소스 단일 이미지 재구성 방식들을 정량적으로도 정성적으로도 능가해요.
저자
TripoSR은 Stability AI와 Tripo AI의 협업이에요. 기술 보고서에는 열 명의 저자가 명시되어 있어요:
- Dmitry Tochilkin
- David Pankratz
- Zexiang Liu
- Zixuan Huang
- Adam Letts
- Yangguang Li
- Ding Liang
- Christian Laforte
- Varun Jampani
- Yan-Pei Cao
인용 방법
학술 작업에서 TripoSR을 인용하려면 다음 BibTeX 항목을 사용하세요:
@article{TripoSR2024,
title={TripoSR: Fast 3D Object Reconstruction from a Single Image},
author={Tochilkin, Dmitry and Pankratz, David and Liu, Zexiang and Huang, Zixuan and Letts, Adam and Li, Yangguang and Liang, Ding and Laforte, Christian and Jampani, Varun and Cao, Yan-Pei},
journal={arXiv preprint arXiv:2403.02151},
year={2024}
}