Algorithms
- Locality Sensitive Hashing
Locality Sensitive Hashing LSH 는 유사한 데이터를 빠르게 찾는 방...
Soopace Study Archive
Study notes are grouped as series cards. Use the topic filters to narrow the archive without leaving the page.
Locality Sensitive Hashing LSH 는 유사한 데이터를 빠르게 찾는 방...
Reference: Google Big Query 구글 빅쿼리 BigQuery 는 머신러닝...
구글 빅쿼리에서 지리정보 데이터를 다루는 방법에 대해 알아본다. GEOGRAPHY라는 타입...
스무고개에서 출발해 자기정보량(self-information), 비트(bit)와 내트(nat), 언어 모델의 토큰 손실(token loss)까지 연결한다.
우산과 비 예제로 확률변수, 결합·주변·조건부확률, 독립, 베이즈 정리를 익히고 다음 토큰 확률까지 연결한다.
자기정보량의 평균에서 샤논 엔트로피를 정의하고, 동전과 다음 토큰 분포로 최대 엔트로피와 예측 불확실성을 이해한다.
정보의 놀라움에서 언어 모델의 손실 함수까지 공부하는 12주 핵심 과정과 4주 심화 과정
Transformer의 기초부터 모델 학습과 서빙, 이미지와 언어를 함께 다루는 VLM, 경험을 저장하고 다시 쓰는 Agent Memory까지 직접 실험하며 익히는 과정
문장을 token으로 나누고, Transformer가 다음 token의 확률과 loss를 계산하는 과정을 배운다.
Base model이 다음 token을 배우고, instruction model이 질문에 맞춰 답하는 방식을 익히는 과정을 비교한다.
질문과 모범 답안을 token으로 바꾸고, assistant 답변의 loss로 작은 언어 모델을 학습하는 과정을 익힌다.
전체 weight를 고치는 대신 작은 adapter를 학습하고, 4-bit 양자화로 GPU 메모리를 더 줄이는 방법을 익힌다.
agent가 환경과 상호작용하며 reward를 모으는 과정을 배우고 작은 길 찾기 문제에서 REINFORCE와 baseline을 구현한다.
사람이 고른 chosen·rejected 답변으로 Reward Model을 학습하고 pairwise loss와 reward accuracy를 읽는 방법을 익힌다.
Policy, reference, Reward Model, value model이 함께 답변을 만들고 PPO clipping과 KL penalty로 policy를 조금씩 고치는 과정을 익힌다.
chosen·rejected 답변의 상대 log probability를 비교해 Reward Model과 rollout 없이 선호를 학습하는 DPO를 익힌다.
DPO, IPO, KTO, ORPO가 어떤 선호 데이터를 받고 무엇을 최적화하는지 비교하고 데이터에 맞는 방법을 고른다.
같은 prompt에서 여러 답을 뽑아 그룹 점수로 advantage를 만드는 GRPO를 손계산과 작은 정책 학습으로 익힌다.
도구 선택부터 최종 답까지 이어지는 trajectory를 단계별 reward로 채점하고 GRPO가 편법 대신 올바른 tool use를 배우게 한다.
Base, SFT, DPO, GRPO를 같은 prompt와 evaluator로 비교하고 자동 점수의 오류를 사람이 읽어 확인하는 평가 보고서를 만든다.
Model weight와 KV cache 크기를 직접 계산하고 context, batch, GQA가 추론 메모리를 어떻게 바꾸는지 살펴본다.
Prefill과 decode를 나누고 TTFT, TPOT, throughput, goodput으로 추론 서버의 속도를 공정하게 측정한다.
OpenAI-compatible API 요청이 scheduler와 model runner를 거쳐 streaming 응답이 되는 흐름을 익히고 vLLM, SGLang, TensorRT-LLM을 비교한다.
양자화와 multi-GPU parallelism을 구분하고 latency, goodput, KV cache, 오류를 함께 보는 Production serving report를 만든다.
RGB 이미지가 pixel_values와 patch embedding으로 바뀌어 Vision Transformer에 들어가는 과정을 실제 tensor shape로 따라간다.
CLIP이 이미지와 영어 문장을 같은 embedding 공간에 놓는 원리를 배우고, contrastive loss·검색·zero-shot 분류를 직접 실행한다.
LLaVA의 projector, BLIP-2의 Q-Former, Flamingo의 Perceiver Resampler가 이미지 특징을 LLM의 visual token으로 바꾸는 방식을 비교한다.
이미지와 글이 섞인 message를 VLM 입력으로 바꾸고, 정답 부분만 학습하는 LoRA 실습으로 데이터 구성과 대조 평가를 익힌다.
Caption, VQA, 문서 읽기, 공간 관계, grounding, object hallucination을 과제에 맞는 지표로 평가하고 이미지 대조 실험으로 실패 원인을 나눈다.
이미지가 VLM의 시각 토큰으로 바뀌는 과정부터 TTFT, TPOT, 메모리 측정, 여러 이미지 요청, vLLM 서빙과 외부 미디어 보안까지 다룬다.
Memory, Knowledge Base, Conversation History, Agent State를 구분하고 semantic·episodic·procedural memory와 저장·검색·갱신 생명주기를 익힌다.
Agent의 write policy, raw·summary·structured memory 표현, dense·keyword·recency·importance 검색, rerank, 충돌 갱신과 삭제를 구현한다.
Episodic memory의 trajectory와 feedback에서 reflection을 만든다. 여러 작업에 다시 쓰는 procedural skill library도 정리한다.
장기 기억의 검색과 최종 답변을 따로 평가한다. 시간·갱신·모름 판단·비용·사용자 격리·삭제·memory poisoning 방어도 점검한다.
https://www.youtube.com/playlist?list=PLIUOU7oqGTL...
Reference: MongoDB MongoDB is a document database...
Reference: MongoDB 이번 시간에는 데이터베이스, 컬렉션, 도큐먼트를 생성하는...
Reference: MongoDB 어플리케이션에 따라 데이터를 조회하는 패턴이 다르고 퍼포...
Reference: MongoDB MongoDB에서는 다양한 언어로 개발을 지원하기위해 여...
End-to-End Memory Network Pytorch 구현 코드: https://g...
A Structured Self-Attentive Sentence Embedding 네이버...
A Neural Probabilistic Language Model paper: A Neu...
Explaining Explanations: An Overview of Interpreta...
Paper Link: Attention Is All You Need ------------...
Paper Link: Deep Inside Convolutional Networks: Vi...
Mask-Predict: Parallel Decoding of Conditional Mas...
Paper Link: Classifier-agnostic saliency map extra...
Explainable Artificial Intelligence XAI : Concepts...
Introduction & Related Work and Existing Datasets...
Feature Visualization 논문을 보면서 정리한다는게 통째로 번역을 해버렸다...
Abstract BRIDGE 모델 제안 : Bridging Textual and Tabul...
Abstract Hybrid Ranking Network for Text-to-SQL 제안...
Reference: Pixabay Abstract 금융, 의료 분야의 머신러닝은 정확도뿐만...
Refernece: Pixabay 데이터사이언스 대학원 강화학습 수업을 듣고 정리한 내용입...
Reference: Pixabay 데이터사이언스 대학원 강화학습 수업을 듣고 정리한 내용입...
데이터사이언스 대학원 강화학습 수업, Deep RL Bootcamp 를 듣고 정리한 내용입...
데이터사이언스 대학원 강화학습 수업을 듣고 정리한 내용입니다. Policy Evaluati...
데이터사이언스 대학원 강화학습 수업을 듣고 정리한 내용입니다. Monte Carlo Met...
데이터사이언스 대학원 강화학습 수업을 듣고 정리한 내용입니다. Temporal Differ...
데이터사이언스 대학원 강화학습 수업을 듣고 정리한 내용입니다. n-step TD 방법은 M...
데이터사이언스 대학원 강화학습 수업을 듣고 정리한 내용입니다. 지금까지는 model-bas...
영상링크: https://youtu.be/MzVlYYGtg0M Optimal control...
영상링크: https://youtu.be/EcxpbhDeuZw Why should we w...
No study series matches this topic.