전체 글 20

(가벼운리뷰) ImageBind: One Embedding Space To Bind Them All

ImageBind learns a joint embedding across six different modalities - images, text, audio, depth, thermal, and IMU data. It enables novel emergent applications ‘out-of-the-box’ including cross-modal retrieval, composing modalities with arithmetic, cross-modal detection and generation. 6개의 다른 모달리티를 하나의 embedding space에 투영하는 방법론을 제안했으며 사용한 모델은 ViT로 간단한 것 같음.  - image, depth, termal 데이터의 경우 ViT를 그대로..

MultiModal 2025.02.04

(논문 수식이해) Classifier Free Diffusion method 위주 : CLASSIFIER-FREE DIFFUSION GUIDANCE

GAN과 flow-based model에서의 생성모델은 FID를 낮추고 IS를 높이기 위해 noise input이나 분산을 낮추어 diversity를 낮추고 성능을 높이고자 했다. 하지만 diffusion에서는 이러한 조작이 큰 효과를 보이지 못했다고 한다. 그래서 등장한 것이 Classifier guidance Diffusion이다. 앞선 포스팅에서 다뤘던 Classifier guidance Diffusion은 보조 classifier model을 추가하여 classifier의 gradient를 활용해 학습을 했다.위 그림에서 class에 강도를 더할수록 guidance strength가 강해지는 것을 알 수 있다. scaling factor를 조정하여 원하는 클래스의 이미지를 강하게 생성할 수 있는 ..

Generative AI 2024.12.16

(논문 수식이해) Classifier Guidance Diffusion method 위주 : Diffusion Models Beat GANs on Image Synthesis

클래스가 주어진 디퓨전 즉, Classifier Guidance Diffusion은 DDPM과 DDIM에 class 정보가 추가로 주어졌을 때의 분포를 학습하는 것이다.  클래스가 주어진 DDPM의 새로운 분포 q_hat에 대한 아래 4가지 기본 정의와 성질을 알아야한다. 4개의 수식에 대해 알아보면, class가 주어지든 주어지지 않든 DDPM의 x0에서의 분포는 동일하며, x0가 주어졌을  때 class의 분포는 완벽히 정의되어있고, y가 주어졌을 때의 forward pass는 DDPM과 동일하고, class가 주어져도 markovian chain rule을 따른다는 것을 확인할 수 있다.  classifier guidance DDPM의 경우 동일하게 denoising 과정, 즉 backward pa..

Generative AI 2024.12.14

(논문 수식이해) DDIM method 위주 : DENOISING DIFFUSION IMPLICIT MODELS

DDPM은 forward pass를 markovian chain으로 정의하고, backward pass 역시 gaussian이라는 것을 유도하여 mean과 var를 reparameterization하여 noise를 구하는 방법으로 구하는 방법이였다. DDPM의 경우는 noise로부터 data로 찾아갈 때 step by step으로 모든 과정을 sampling해야하기 때문에 연산량이 많고 속도가 느리다는 단점이 있었다.  이 문제를 해결하고자 DDIM이 등장한 것이고, 이 DDIM의 기본철학은 DDPM과 Marginal만 동일하게 인공적으로 만들어서 data에서 noise로 denoising되는 전체 과정의 분포는 다르겠지만 각 step마다의 분포는 동일하게 만드는 backward를 정의하는 것이다.  즉..

Generative AI 2024.12.12

EfficientML.ai Lecture 15 - GAN, Video, and Point Cloud (MIT 6.5940, Fall 2023)

GANsGAN, C-GAN, Diffusion과 같은 생성모델은 인식모델보다 expensive (param수 측면 & 연산 측면)- GAN CompressionNeural Architecture Search와 Distillation과 유사한 방법이다. 사전학습된 teacher 모델로부터 channel의 일부 configuration만 만들어서 distllation을 진행하는 방법으로 생성된 feature map의 L2 norm을 최소화하는 방법으로 optimize를 진행한다. - Anycost GANGAN을 통해서 image editing이 가능하다. 예를 들면, original img를 latent space로 embedding을 하고, w의 gradient 방향을 조금씩 이동시켜서 특징의 정도를 조작..

EfficientML 2024.10.31

EfficientML.ai Lecture 14 - Vision Transformer (MIT 6.5940, Fall 2023)

https://www.youtube.com/watch?v=fcmOYHd57Dk • Basics of Vision Transformer (ViT)img를 패치화한 후 각 패치를 embedding하여 transformer의 encoder에 넣는다. 위 그림에서처럼 patch size에 변주를 주거나 layer, hidden dim 등에 변화를 주면 다양한 모델의 형태를 얻을 수 있다. 위 그림을 보면 작은 데이터셋에 대해서는 CNN보다 ViT가 더 성능이 낫고 충분히 큰 데이터셋에서만 우세한 성능을 보이는 것을 알 수 있어 이 점이 한계이다. • Efficient ViT & acceleration techniques고해상도 이미지가 예측에 있어서 중요한데, ViT는 이미지 해상도가 증가함에 따라 계산량이 q..

EfficientML 2024.10.29

EfficientML.ai Lecture 16 - Diffusion Model (MIT 6.5940, Fall 2023)

https://www.youtube.com/watch?v=nFE1euQ_WtwBasics of diffusion model• Denoising diffusion modelsDDPM은 2가지 process로 구성되어있다. noise를 점진적으로 추가하는 forward process를 정의하고 이 것의 반대과정을 도출한 것인 reverse process를 학습하여 data를 generate하는 것이다. GAN과 비교해보았을 때, DDPM은 iterative mapping을 Gaussian noise로부터 정의하여 생성과정 역시 step by step이지만, GAN은 한번의 step만으로 데이터를 생성한다. original data x0에서 노이즈를 점진적으로 주입하면 시간의 흐름에 따라 Xt가 되고 T까지 ..

EfficientML 2024.10.25

EfficientML.ai Lecture 13 - Transformer and LLM (Part II) (MIT 6.5940, Fall 2023)

1. Efficient inference algorithms for LLMs(1) Quantization : SmoothQuant, AWQ, TinyChatqunatization : 실수 r을 정수 q로 양자화하여 실수 scaling factor를 이용하여 압축하고 복원하는 과정을 의미함. [ 연산을 단순화하면서 성능 저하를 최소화하는 것이 목표] - SmoothQuant(W8A8)8bit로 weight와 activation을 양자화 하는 방식으로 CNN에서 널리 사용하지만 LLM에서는 특정 크기 이상에서는 LLM의 activation outlier들이 발생하여 성능이 급격히 하락하는 것을 알 수 있다. 이를 극복하기 위해 Activation에서 발생하는 양자화 문제를 일부 Weight로 이동시킴.smo..

EfficientML 2024.10.22

EfficientML.ai Lecture 12 - Transformer and LLM (MIT 6.5940, Fall 2024)

1. Transformer basics1) Pre-Transformer* RNNsRNN 계열 모델의 경우 Bi-direction일 경우는 discriminate task로 encoding역할을 하고, Uni-direction일 경우는 generative task로 decoding의 역할을 한다.  token간의 의존성 때문에 병렬처리가 어렵다는 단점이 있었고, input size가 커질수록 정해진 hidden dim에 정보를 compressive하게 저장하는 것이 어려웠다. 또 n번째 state를 알기 위해서는 n-step의 forward process를 거쳐야하므로 parallelism의 한계점이 존재한다. * CNNs CNN의 경우는 한번의 KERNEL 연산에서 인접한 KERNEL SIZE만큼의 to..

EfficientML 2024.10.21

(논문 수식이해) DDPM method 위주 : Denoising Diffusion Probabilistic Models

Diffusion은 original data에 gaussian noise를 점진적으로 주입하여 original data를 파괴하는 과정을 의미한다. DDPM은 forward process에서 데이터에 점진적으로 노이즈를 추가하는 고정된 markov chain을 사용하고, reverse process에서 이를 학습 가능한 Gaussian transitions으로 denoising하는 latent variable model DDPM 은 데이터 x0를 생성하기 위해 일련의 latent variable x1,x2,…,xT를 사용하는 모델로 각 잠재 변수 xt는 데이터 x0와 동일한 차원을 가진다. 2. Background이 모델의 목적은 주어진 데이터 분포에서 새로운 데이터를 생성하는 것으로  reverse p..

Generative AI 2024.10.18