Algorithms
- Locality Sensitive Hashing
Locality Sensitive Hashing LSH 는 유사한 데이터를 빠르게 찾는 방...
Soopace Study Archive
Study notes are grouped as series cards. Use the topic filters to narrow the archive without leaving the page.
Locality Sensitive Hashing LSH 는 유사한 데이터를 빠르게 찾는 방...
Reference: Google Big Query 구글 빅쿼리 BigQuery 는 머신러닝...
구글 빅쿼리에서 지리정보 데이터를 다루는 방법에 대해 알아본다. GEOGRAPHY라는 타입...
The fundamental problem of communication is that o...
https://www.youtube.com/playlist?list=PLIUOU7oqGTL...
Reference: MongoDB MongoDB is a document database...
Reference: MongoDB 이번 시간에는 데이터베이스, 컬렉션, 도큐먼트를 생성하는...
Reference: MongoDB 어플리케이션에 따라 데이터를 조회하는 패턴이 다르고 퍼포...
Reference: MongoDB MongoDB에서는 다양한 언어로 개발을 지원하기위해 여...
End-to-End Memory Network Pytorch 구현 코드: https://g...
A Structured Self-Attentive Sentence Embedding 네이버...
A Neural Probabilistic Language Model paper: A Neu...
Explaining Explanations: An Overview of Interpreta...
Paper Link: Attention Is All You Need ------------...
Paper Link: Deep Inside Convolutional Networks: Vi...
Mask-Predict: Parallel Decoding of Conditional Mas...
Paper Link: Classifier-agnostic saliency map extra...
Explainable Artificial Intelligence XAI : Concepts...
Introduction & Related Work and Existing Datasets...
Feature Visualization 논문을 보면서 정리한다는게 통째로 번역을 해버렸다...
Abstract BRIDGE 모델 제안 : Bridging Textual and Tabul...
Abstract Hybrid Ranking Network for Text-to-SQL 제안...
Reference: Pixabay Abstract 금융, 의료 분야의 머신러닝은 정확도뿐만...
Refernece: Pixabay 데이터사이언스 대학원 강화학습 수업을 듣고 정리한 내용입...
Reference: Pixabay 데이터사이언스 대학원 강화학습 수업을 듣고 정리한 내용입...
데이터사이언스 대학원 강화학습 수업, Deep RL Bootcamp 를 듣고 정리한 내용입...
데이터사이언스 대학원 강화학습 수업을 듣고 정리한 내용입니다. Policy Evaluati...
데이터사이언스 대학원 강화학습 수업을 듣고 정리한 내용입니다. Monte Carlo Met...
데이터사이언스 대학원 강화학습 수업을 듣고 정리한 내용입니다. Temporal Differ...
데이터사이언스 대학원 강화학습 수업을 듣고 정리한 내용입니다. n-step TD 방법은 M...
데이터사이언스 대학원 강화학습 수업을 듣고 정리한 내용입니다. 지금까지는 model-bas...
영상링크: https://youtu.be/MzVlYYGtg0M Optimal control...
영상링크: https://youtu.be/EcxpbhDeuZw Why should we w...
Transformer의 기초부터 SFT, DPO, GRPO, 추론 최적화와 모델 서빙까지 직접 실험하며 익히는 과정
문장을 token으로 나누고, Transformer가 다음 token의 확률과 loss를 계산하는 과정을 배운다.
Base model이 다음 token을 배우고, instruction model이 질문에 맞춰 답하는 방식을 익히는 과정을 비교한다.
질문과 모범 답안을 token으로 바꾸고, assistant 답변의 loss로 작은 언어 모델을 학습하는 과정을 익힌다.
전체 weight를 고치는 대신 작은 adapter를 학습하고, 4-bit 양자화로 GPU 메모리를 더 줄이는 방법을 익힌다.
agent가 환경과 상호작용하며 reward를 모으는 과정을 배우고 작은 길 찾기 문제에서 REINFORCE와 baseline을 구현한다.
사람이 고른 chosen·rejected 답변으로 Reward Model을 학습하고 pairwise loss와 reward accuracy를 읽는 방법을 익힌다.
Policy, reference, Reward Model, value model이 함께 답변을 만들고 PPO clipping과 KL penalty로 policy를 조금씩 고치는 과정을 익힌다.
chosen·rejected 답변의 상대 log probability를 비교해 Reward Model과 rollout 없이 선호를 학습하는 DPO를 익힌다.
No study series matches this topic.