전체 글 35

LLM 기초 (2) Attention 직관 - QKV가 무엇을 "참고"하는가

지난 글 끝에 "문맥에 따라 단어 표현이 바뀐다"고 적었다. 그걸 만드는 장치가 Attention이다. 1. 왜 Attention(어텐션)이 필요한가: 임베딩만 놓고 보면 '말'은 늘 같은 벡터 ("말을 타다"의 말이나 "말을 하다"의 말이나 똑같음): 그런데 뜻은 옆 단어가 정함 ('타다'가 붙으면 동물, '하다'가 붙으면 언어): 그래서 각 토큰이 "같은 문장의 다른 토큰을 얼마나 볼지" 정하고, 그만큼 정보를 섞어 자기 표현을 갱신함 → 이게 attention 2. Q, K, V — 검색에 빗대기 attention이 하는 일은 도서관에서 자료 찾기와 닮았다. 1) query (q) : 지금 내가 찾는 것. "어떤 정보가 필요한가"를 담은 벡터2) key (k) : 각 토큰이 내건 꼬리표. "나는..

AI/Basic 11:13:45

LLM 기초 (1) 다음 토큰 예측

LLM 을 처음부터 정리해 보기로 했다. 첫 글은 언어 모델이 실제로 하는 일 한 가지. 1. LLM 이 학습하는 목표: 앞 단어들이 주어졌을 때 다음에 올 단어(토큰)를 맞히는 것, 이게 전부다 : 맞힌 걸 뒤에 붙이고 또 다음을 맞힘 → 이 반복으로 문장이 완성됨 (autoregressive) 학습도 같다. 원문의 다음 단어가 곧 정답이라 사람이 라벨을 달 필요가 없음 → 인터넷 규모로 학습 가능한 이유. 2. 토큰 (token)모델은 단어를 그대로 안 보고, 자주 붙어 다니는 문자 덩어리인 토큰 으로 쪼갠다. 한국어는 조사 또는 어미로 형태가 계속 바뀌고 학습 데이터에도 덜 등장해 토큰을 많이 먹는다. 토큰이 많으면 api 비용 ↑, 컨텍스트 창 소모 ↑, 속도 ↓. (실제 조각은 토크나이저마..

AI/Basic 2026.09.09

Sub-center ArcFace: Boosting Face Recognitionby Large-scale Noisy Web Faces

paperswithcode : https://paperswithcode.com/paper/sub-center-arcface-boosting-face-recognition Papers with Code - Sub-center ArcFace: Boosting Face Recognition by Large-scale Noisy Web FacesImplemented in 2 code libraries.paperswithcode.com 오늘은 이전 ArcFace 에서 잠깐 나왔던 내용인 sub-center ArcFace 에 대한 논문을 읽어 보았다ArcFace 에 대하여 잘 모른다면https://lululalams.tistory.com/10 ArcFace: Additive Angular Margin Loss fo..

Paper/Vision 2024.06.06

ViTPose: Simple Vision Transformer Baselines forHuman Pose Estimation

paperswithcode : https://paperswithcode.com/paper/vitpose-simple-vision-transformer-baselines Papers with Code - ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation🏆 SOTA for Pose Estimation on COCO test-dev (AP metric)paperswithcode.com 오늘은 ViTPose 라는 pose estimation 논문에 대해 읽어 보았다이전에 코드를 사용한 적은 있는데, 논문을 제대로 읽어보지 못했기 때문에 이번 기회에 다시 한번 읽어 보았다  Abstract vision transformer 가 pose..

Paper/Vision 2024.05.31

Revisiting the Importance of Amplifying Bias for Debiasing

kakao enterprise ai reseach 에서 papers 를 보다가 발견한 논문https://kakaoenterprise.github.io/papers/aaai-debiasing Revisiting the Importance of Amplifying Bias for DebiasingAbstractkakaoenterprise.github.io 이전 얼굴 이미지 데이터셋을 이용했을때도 항상 배경이나, 헤어스타일, 악세사리 등 편향적 특성이 강하게 나타나면 학습에 악영향을 끼치는 경우가 많았다이런 경우를 위해 Debiasing 을 하는데 , 이 논문은 2022 에 발표된 논문으로 debiasing 성능을 개선하기 위한 새로운 접근법을 보여주고 있다 Abstractdebiasing 은 데이터셋의 bi..

Paper/Vision 2024.05.30

Knowledge Distillation

Knowledge Distillation: 지식 증류, 미리 학습된 큰 Teacher 모델을 이용하여 Student 모델을 학습함: 작은 student 모델을 사용하여 모델 압축(경량화)에 사용되기도 함: unlabeled data 에 pseudo-labeling 을 적용하기도 함 1. Unlabeled data 만 있을때label 없이 input 을 넣은 후 나온 output 을 이용하여 KL divergence loss 를 구함 ( 두 확률 분포의 차이를 계산 )이때 loss 를 이용한 역전파는 student 모델에서만 일어남 2. labeled data 가 있을때1) labeled data 를 input 으로 넣고, teacher 와 student 의 softmax(T=t) 를 거친 soft lab..

AI/Basic 2024.05.23

Transfer learning

transfer learning: 전이 학습, 보통 CNN 은 두고 fully connected 단을 변경 하여 학습 1. freezefully 변경 후 CNN 단은 freeze 하고 fully 단만 학습 하는 방법학습이 빠르고, 아주 적은 데이터셋으로도 가능 2. whole trainfully 변경 후 CNN 단은 낮은 학습률, fully 는 높은 학습률을 설정하고 전체를 학습하는 방법학습이 상대적으로 오래 걸리고 더 많은 데이터셋이 필요하지만 더 높은 성능을 냄

AI/Basic 2024.05.23

AdaFace: Quality Adaptive Margin for Face Recognition

paperswithcode : https://paperswithcode.com/paper/adaface-quality-adaptive-margin-for-face Papers with Code - AdaFace: Quality Adaptive Margin for Face Recognition 🏆 SOTA for Surveillance-to-Booking on IJB-S (Rank-1 metric) paperswithcode.com 오늘은 AdaFace 를 읽어보았다 ArcFace 와 비슷한 이름, 하지만 저품질 데이터셋에 대하여 ArcFace 보다 좋은 성능.. 어떤 것에서 차이가 있을까 궁금하였다 Abstract 저품질의 얼굴 데이터셋을 이용한 인식은 얼굴 속성을 잘 이해하기 힘들기 때문에 계속 도전되..

Paper/Vision 2024.04.18