전체 글(30)
-
CS231n Generative Models 1
생성형 AI 이전에 어떤 기술들이 있었을까?최근 AI 분야의 중심에는 생성형 AI가 있다.ChatGPT, 이미지 생성 AI, 영상 생성 모델까지 모두 생성 모델 기반으로 동작한다.하지만 생성형 AI는 갑자기 등장한 기술이 아니다.그 이전에는 데이터를 이해하기 위한 다양한 연구 흐름이 존재했고, 특히 자기지도학습(Self-Supervised Learning)이 매우 중요한 역할을 했다. -> 자기지도학습부터 DINO, 그리고 생성 모델까지 이어지는 흐름을 중심으로 생성형 AI의 기반 기술들을 정리 지도학습의 한계초기 딥러닝 모델은 대부분 지도학습(Supervised Learning) 기반 지도학습은 입력 데이터와 정답(label)이 함께 존재하는 데이터를 사용한다.(예를 들어 강아지 사진에는 “dog”,..
2026.05.27 -
Part1. CS231N Self-Supervised Learning
대규모 레이블링 데이터 없이 신경망을 훈련하는 방법은 무엇인가? 자기 지도 학습(Self-Supervised Learning)은 레이블이 없는 데이터로 사전 과제를 정의하여 좋은 특징을 학습하고, 이를 활용해 적은 양의 레이블 데이터로 다운스트림 작업을 수행하는 방식입니다.(다운스트림 작업 : 사전 학습된 모델을 가져와서 내가 해결하고 싶은 문제에 맞게 미세 조정(fine-tuning)하는 것) 자기 지도 학습(Self-Supervised Learning)의 필요성 및 기본 개념 자기 지도 학습(Self-Supervised Learning)은 대규모 레이블 데이터 없이 신경망을 학습시키는 방법으로, 레이블이 없는 데이터 안에서 모델이 스스로 정답을 만들어 학습할 수 있는 문제를 설정하여 유용한 특징을 ..
2026.05.13 -
CS231n 2025 assignment2. Image Captioning with RNNs
RNN 기반 Image Captioning 구현 정리CS231n Assignment2 - Image Captioning with RNNs 정리기반 코드: COCO Dataset + Vanilla RNN + PyTorch참고 코드: Stanford CS231n Assignment2 fileciteturn0file0 1. Image Captioning이란?Image Captioning은 이미지를 입력받아 자연어 문장을 생성하는 작업이다.예를 들어 아래와 같은 형태이다.입력: 강아지 사진출력: "a dog is running on the grass"즉, Computer Vision (이미지 이해)와 Natural Language Processing (문장 생성) 을 동시에 사용하는 대표적인 멀티모달(Mu..
2026.05.06 -
Part1. Video Understanding
Video = 2D Images + Time Dimension 비디오는 단순한 이미지가 아니라 시간 축이 추가된 데이터이다.즉, 여러 장의 이미지가 시간 순서대로 이어진 구조 (T x 3 x H x W) T: 시간(Temporal) 차원 → 비디오가 몇 개의 프레임(시간 순서)을 가지는지3: 채널(Channel) 차원 → 각 프레임의 색상 채널 수 (RGB이므로 3개)H (Height): 세로 공간 차원 → 프레임의 높이(픽셀 수)W (Width): 가로 공간 차원 → 프레임의 너비(픽셀 수)→ 비디오는 “이미지 + 시간”으로 이루어진 4D 시퀀스 데이터 비디오에는 motivating task(핵심 목표 작업) 이 있습니다.기존 이미지 분류(Image Classification)는 하나의 정적인 이..
2026.05.06 -
Part1. Visualizing and Understanding
1. First Layer: Visualize Filters CNN의 First Layer의 필터들은 원본 이미지의 low-level features을 포착하며, 네트워크가 어떻게 입력 데이터를 처리하는지에 대한 정보를 제공한다. Conv 필터는 sliding window로 이미지를 돌고, 이미지의 일부 영역과 내적을 수행한다. 이렇게 필터의 가중치와 내적한 결과가 First Layer의 출력이기 때문에 단순히 시각화시키는 것 만으로도 이 필터가 이미지에서 무엇을 찾고 있는지 알아낼 수 있는 것이다. 왜냐하면 내적 값을 최대화 시키는 방법은 동일한 값 두 개를 내적하는 것이기 때문에, 필터 값을 가장 활성화시키는 입력은 입력 값과 필터의 가중치 값이 동일한 경우이다. CNN을 어떤 모델/데이터로 ..
2026.04.29 -
Part1. Detection and Segmentation
컴퓨터 비전에서 semantic segmentation, localization, object detection, instance segmentation은 모두 이미지에서 물체를 인식하고 위치를 파악하거나 분리하는 주요 task이다. 1. Semantic SegmentationSemantic Segmentation은 이미지 내 각 픽셀에 대해 해당 픽셀이 어떤 클래스에 속하는지를 예측하는 작업을 의미한다. 픽셀 단위 분류: classification과 달리, 단일 클래스가 아닌 모든 픽셀을 개별적으로 분류한다.클래스 중심: 같은 클래스의 여러 객체는 하나로 취급한다.물체 인식 + 위치 정보를 동시에 제공하지만, 객체 인스턴스 구분은 하지 않는다. Semantic Segmentation Idea: Sli..
2026.04.29