전체 글22 [강의 정리] CS224n 2. Word Vectors and Language Models https://www.youtube.com/watch?v=nBor4jfWetQ&list=PLoROMvodv4rOaMFbaqxPDoLWjDaRAdP9D&index=2위 영상을 보며 정리한 내용입니다. GloVe: Global Vectors for Word RepresentationMotivationWord2Vec 등의 기존 모델들은 지역적 문맥(window-based context)에 집중corpus 전체의 전역 통계(global co-occurance statistics)를 활용하면 더 안정적이고 의미적으로 잘 정렬된 벡터 생성 가능단어들의 동시 등장 확률(co-occurance probability)를 활용해 벡터를 학습시킴 Key idea단어의 의미는 그 단어가 어떤 단어들과 자주 같이 등장하는.. 2025. 9. 30. [강의 정리] Seq2Seq Learning Sequence to Sequence Learning Seq2Seq 모델은 단어, 이미지의 특징 등 시퀀스 데이터를 입력받아 또 다른 시퀀스를 출력하는 구조를 갖는다. 입력 시퀀스와 출력 시퀀스의 길이는 반드시 같을 필요는 없으며, 다양한 길이의 시퀀스를 유연하게 처리할 수 있다. 이 모델은 인코더와 디코더라는 두 구성 요소로 이루어져 있다. 인코더 (Encoder)입력 시퀀스의 각 항목(단어, 이미지 특징 등)을 처리하여 정보를 압축한다.입력이 순차적으로 인코더에 들어가며, 그때마다 hidden state가 업데이트됨모든 입력이 처리된 후, 마지막 hidden state가 context vector로 사용됨이 context vector는 입력 시퀀스 전체를 요약한 정보이지만, 긴 시퀀스에서는 앞부분의.. 2025. 5. 8. [강의 정리] ML/DL for Everyone Season2 - Logistic Regression Logistic Regressiond차원의 mmm개 샘플을 입력받아 d×1 크기의 가중치 W와 내적한 뒤, 시그모이드 함수를 통해 0과 1 사이의 값이 출력됨주로 이진 분류를 하는 데에 사용됨Hypothesis는 시그모이드 함수 형태를 따르며, 항상 0과 1 사이의 값이 출력됨출력값에 임계값을 지정하여 이를 0 혹은 1로 분류하는 데 사용됨H(X)는 어떤 입력 X가 정답(1)일 확률을 나타냄 Cost FunctionW는 학습 가능한 파라미터(가중치)이며, 이에 따라 cost함수의 값이 결정됨cost 함수는 전체 데이터에 대해 평균을 내며, 모델이 얼마나 잘 예측했는지를 평가함cost 함수는 모델이 예측한 확률 $H(X)$와 실제 정답 y 사이의 차이를 예측함y가 H(X)와 가까울수록, cost 값.. 2025. 3. 28. [논문 리뷰] STARK: Benchmarking LLM Retrieval on Textual and Relational Knowledge Bases Problem Definition기존 SQL이나 지식 그래프 쿼리는 범위가 제한적이고 사용자의 복잡한 검색 요구를 충족하기에 부족함LLM이 정보 검색에 잠재력을 보였지만, 반구조적 지식베이스(semi-structured knowledge bases, SKBs)에서의 활용 가능성은 아직 불확실함LLM 기반 검색 시스템이 텍스트 정보와 관계 정보를 잘 이해하고 추론할 수 있는지 평가할 필요가 있음대부분의 기존 연구가 Wikipedia 같은 공개된 일반적인 데이터를 활용하여, 비공개 반구조적 지식베이스에 대해서 LLM이 쿼리 속 복잡한 텍스트/관계 요구사항을 어떻게 다룰지는 알 수 없음 Methodology프레임 워크 STARK는 반구조적 지식베이스(SKBs)에서의 정보 검색을 평가하기 위해 구축된 .. 2025. 3. 27. [논문 리뷰] Efficient Estimation of Word Representations in Vector Space 문제 정의많은 자연어 모델들은 단어를 원자 단위로 처리하여 단어간의 유사도를 표현할 수 없음단어가 원핫인코딩으로 표현될 경우, 희소 벡터가 만들어짐 문제 해결 방법론분산 표현을 학습할 수 있으면서 계산 복잡성을 줄이는 두 가지 모델을 제시함분산 표현: 단어/문장을 고차원 공간의 벡터로 표현(dense matrix). 원핫인코딩과 달리, 한 단어를 여러 차원의 실수 요소로 표현되는 벡터 값으로 표현모델 속 비선형 hidden layer이 복잡성을 증가시키기 때문에 log-linear 형태의 모델을 제시함 Continuous Bag-of-Words Model (CBOW) 윈도우 사이즈 만큼의 주변단어들을 활용하여 중심단어의 임베딩을 출력하나의 projection layer(=projection matri.. 2025. 3. 4. [논문 리뷰] Attention is All You Need https://arxiv.org/abs/1706.03762 Attention Is All You NeedThe dominant sequence transduction models are based on complex recurrent or convolutional neural networks in an encoder-decoder configuration. The best performing models also connect the encoder and decoder through an attention mechanism. We propose a newarxiv.org 1. Introduction RNN(순환 신경망)이나 LSTM(장단기 메모리), Gated Recurrent Nerual Net.. 2025. 1. 5. 이전 1 2 3 4 다음