팀네이버, 비전 AI 분야 글로벌 기술력 또 한번 입증…세계 최정상 학회서 논문 대거 채택
팀네이버, 비전 AI 분야 글로벌 기술력 또 한번 입증…세계 최정상 학회서 논문 대거 채택
- ‘ECCV 2026’에 팀네이버 논문 총 23편 게재 승인…3대 비전 학회에 매년 두 자릿수 채택
- 속도·정확도 향상된 ‘더스터’부터 자율주행 시 처음 보는 물체 인식까지…3D 공간 재구성 기술 고도화
- ▲360도 공간 재구성 ▲서울월드모델 연구 등 4건 ‘ECCV Spotlight’ 선정되기도
2026-08-28
팀네이버가 발표한 연구 논문 23편이 컴퓨터비전 분야 세계 최정상 학회 중 하나인 ‘ECCV(European Conference on Computer Vision, 유럽 컴퓨터비전 학회) 2026’에 게재 승인되며, 글로벌 수준의 공간지능 기술 경쟁력을 다시 한 번 증명했다.
올해로 19회차를 맞은 ECCV는 영상·이미지 처리 등 컴퓨터비전 분야 세계 최고 권위의 AI 학회로 꼽히며, 2년 주기로 개최된다. 이번 ECCV 2026은 오는 9월 8일부터 12일까지 스웨덴에서 열린다. 네이버랩스, 네이버랩스 유럽, 네이버 AI Lab, 네이버클라우드 등 팀네이버의 기술 조직들은 이 자리에서 채택된 논문들을 발표할 예정이다.
이번 학회에는 3D 공간 인식 및 재구성, 이미지·영상 학습 모델, 로봇 주행 시뮬레이션 등 다양한 비전 기술 분야에서 팀네이버의 논문 23건이 정규 논문으로 채택됐다. 특히 3D 공간 재구성 관련 연구들이 대거 게재 승인되며 비전 AI 분야에서 팀네이버의 선도적인 기술력을 다시 한번 인정받았다.
먼저, 네이버랩스 유럽은 글로벌 3D비전 업계의 이목을 끌었던 ‘더스터(DUSt3R)’*의 후속 연구 ‘블래스터(BLASt3R)’를 선보였다.(제목: BLASt3R: bundle adjustment of any image set with multi-view matching and monocular priors) 블래스터는 로봇이 주행하며 실시간으로 주변 환경의 지도를 제작할 수 있는 ‘SLAM(Simultaneous Localization and Mapping, 동시적 위치추정 및 지도작성)’ 기법을 접목해 온디바이스 환경에서도 3D 재구성 작업을 가능하게 하는 등, 기존 모델 대비 속도와 정확도를 대폭 향상했다.
* 2023년 공개된 네이버랩스 유럽의 3D 재구성 기술로, 사진 1-2장으로 전체 공간을 입체로 복원할 수 있는 AI 도구
또, 네이버랩스가 발표한 실내 3D 공간 생성 관련 연구는 360 파노라마 이미지 한 장으로 방의 구조와 사물을 재구성해 학계의 주목을 받았다.(제목: InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image) 그 외에도 네이버랩스는 자율주행 시 VLM(Vision-Language Model, 비전 언어 모델)을 활용해 학습하지 않은 물체까지 인식하고, 이를 실시간으로 정확한 BEV(Bird’s-Eye View, 조감도) 지도 상에 담아내는 기술을 선보였다.(제목: Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints)
네이버 AI Lab이 카이스트와 산학협력으로 진행한 ‘서울월드모델’ 연구도 지도 기반 가상 탐색, 디지털트윈, 자율주행·로보틱스 시뮬레이션 등 다양한 분야에서의 활용 가능성을 인정받아 이번 학회에서 정식 논문으로 채택됐다.(제목: Seoul World Model: Grounding World Simulation Models in a Real-World Metropolis) 서울월드모델은 도시 전역의 파노라마 이미지 등 네이버가 보유한 방대한 공간 데이터를 활용해 실제 서울의 모습을 담은 장거리 영상을 생성할 수 있다는 점이 특징이다.
네이버클라우드 역시 AI의 이미지·영상 이해 능력을 한층 끌어올린 연구 성과를 공개했다. 영상 속 사물의 움직임을 정확하게 인식하기 위한 연구와(제목: Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition) 공간의 이미지에 텍스트 기반 추론을 더해 입체감을 더욱 쉽게 파악하도록 하는 연구(제목: SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning) 등이 채택되어, 비전 AI의 정밀도를 높이는 팀네이버의 원천기술 경쟁력을 입증했다.
이 중 360도 공간 재구성 관련 연구(InSpace)와 서울월드모델 연구 등 총 4건의 논문은 전체 제출작 중 약 1~2%에 부여되는 ‘ECCV Spotlight’에 선정되는 쾌거를 이루기도 했다.
한편, 팀네이버는 지속적인 연구개발 투자를 바탕으로 ECCV, CVPR(Computer Vision and Pattern Recognition Conference, 컴퓨터비전 및 패턴인식 컨퍼런스 학술대회), ICCV(International Conference on Computer Vision, 국제 컴퓨터비전 학회) 등 컴퓨터비전 분야 세계 3개 학회에서 매년 두 자릿수 논문 채택 성과를 거두며 세계적인 공간지능 기술력을 입증해왔다.
팀네이버는 앞으로도 적극적인 연구개발을 이어가며 차세대 AI·공간지능 기술을 확보하고, 이를 다양한 서비스에 접목해 사용자가 일상에서 쉽게 체감할 수 있는 기술 경험을 제공해 나갈 계획이다. (끝)
[참고] 팀네이버 ECCV 2026 채택 논문 리스트
1. InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image
2. Wid3R: Wide Field-of-View 3D Reconstruction via Camera Model Conditioning
3. Streaming Dense Voxel Representations for 3D Occupancy Prediction
4. Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints
5. BLASt3R: bundle adjustment of any image set with multi-view matching and monocular priors
6. Whareformer: Learning to track what is where in long egocentric videos
7. Syn4D: a multiview synthetic 4D dataset
8. A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world
9. Task Alignment: a simple and effective proxy for model merging in computer vision
10. Human mesh modeling for Any Body
11. Multi-HMR 2: multi-person camera-centric human detection, mesh recovery and tracking
12. Vulnerability of privacy-preserving visual localization methods against diffusion-based attacks
13. IDeaL: data-free multi-teacher distillation via improved dead leaves
14. Autoregressive 3D scene generation from multi-view data
15. Seoul World Model: Grounding World Simulation Models in a Real-World Metropolis
16. TetraSDF: Precise Mesh Extraction with Multi-resolution Tetrahedral Grid
17. On the Reliability of Cue Conflict and Beyond
18. Isotropic Embedding Perturbations for Robust Vision Language Encoders
19. Relaxed Rigidity with Ray-based Grouping for Dynamic Gaussian Splatting
20. Video-Oasis: Rethinking Evaluation of Video Understanding
21. Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
22. Learning from Adversity: Semantic-Aware Mask Refinement through Adversarial Perturbation
23. SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning