Research notes,
clearly archived.
Papers, experiments, and implementation notes synced from Notion. Browse the latest work or follow a research topic.
[Reading Note] Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture
I-JEPA는 pixel reconstruction이나 hand-crafted augmentation invariance에 의존하지 않고, 보이는 context로부터 가려진 영역의 abstract representation을 예측함으로써 high-level semantic representation을 효율적으로 학습하는 self-supervised learning framework이다.
Recent research notes
[Reading Note] VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training
VideoMAE는 plain ViT에 high-ratio tube masking을 적용해 비디오 reconstruction task를 어렵게 만들고, 작은 데이터셋에서도 강한 video representation을 학습할 수 있음을 보였으며, SSVP에서는 데이터 양보...
[Reading Note] Masked Autoencoders Are Scalable Vision Learners
High-ratio random masking과 asymmetric encoder-decoder를 통해 대규모 ViT를 효율적으로 self-supervised pre-training하고, 강한 transferable visual representation을 학습하는 M...
[Reading Note] Is Space-Time Attention All You Need for Video Understanding?
TimeSformer는 ViT를 video domain으로 확장하여 spatial·temporal attention을 분리한 Divided Space-Time Attention으로 효율적인 convolution-free video recognition을 구현하고, 긴...
[Reading Note] An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale
원래 Transformer의 구조를 최대한 가져온다. 이미지를 작은 패치들로 나누고 이 패치들에 대해 선형적인 임베딩 시퀀스를 Transformer 입력값으로 제공한다. patches를 일종의 tokens로 바라보는 것.
[Reading Note] Attention Is All You Need
[Study Record] 파이토치 첫 걸음
[Reading Note] Two-Stream Convolutional Networks for Action Recognition in Videos
정지 프레임의 외형 정보를 학습하는 공간 스트림과 다중 프레임 optical flow의 움직임 정보를 학습하는 시간 스트림을 분리한 뒤, 두 예측을 후기 융합하여 비디오 행동을 인식하는 Two-Stream ConvNet을 제안한다.
[Reading Note] (1) Concept of VLA: Integration Vision, Language, Action
Vision-Language-Action Models 논문을 읽으며, VLA가 왜 등장했고, 기존 Vision-Language Model과 무엇이 다른거
오리를 관찰하는 AI를 만들고 있습니다 — BMOD 개발기 #1
[Reading Note] 목걸이형 센서를 이용한 머신러닝 기반 가축상태 모니터링
[Reading Note] The Birth of Deep CNNs: Why AlexNet Worked
딥러닝 역사에서 전환점으로 평가받는 AlexNet 논문을 읽으며,이 모델이 왜 “작동했는가”를 정리하기 위해 작성
[Reading Note] Non-deterministic한 LLM 모델은 어떻게 평가할까
이 글은 동일한 입력에서도 출력이 달라지는 LLM의 비결정성이 기존 accuracy 중심 평가로는 충분히 설명되지 않는 문제를 다룬다. 논문을 바탕으로 출력 일관성을 측정하는 TAR@N 지표를 소개한다.
[Tech Insight] Game Off 2025 - Wave
GitHub과 itch.io가 주최하는 게임잼 Game Off 2025를 소개하며, 테마 ‘WAVES’의 다양한 해석과 게임 아이디어, 개발 엔진 선택의 자유, GitHub 협업 경험의 의미를 다룬 글입니다.
[Computer Vision] DeepLabCut Practice
[Research Note] Decoding Animal Actions: How Machines Learn Behaviour
동물 행동학의 전통적 분석에서 딥러닝 기반 자동 분석으로의 전환을 다룬다. Pose Estimation, Object Tracking, Behaviour Classification을 통해 행동을 정량화하고, 예측·설명 가능한 AI로 확장되는 흐름을 탐구한다.
[Reading Note] Inside Session-Based Recommendation: Category Filtering for Smarter Predictions
세션 기반 추천 시스템(SBRs)의 한계인 데이터 품질 저하와 학습 비효율 문제를 해결하기 위해, 논문은 카테고리 기반 데이터 필터링 기법을 제안한다.
[Reading Note] AI Agents vs. Agentic AI
AI Agent와 Agentic AI의 개념적 차이를 중심으로, 각 개념의 구조·특징·한계점을 논문 기반으로 정리하고, 기술적·조직적 관점에서 Agentic AI의 확장 가능성을 탐구한 글
[Research Note] When Matrices Go Infinite (2/2) : ML Perspective
Section 2: ML Perspective: 커널 함수를 활용해 특징 상호작용 공간을 무한 차원으로 확장하고, RBF 커널 기반 InfiNet 구조로 효율적 학습을 구현하는 글
[Research Note] When Matrices Go Infinite (1/2) : Mathematical Intuition
Section 1: Mathematical Intuition: 무한 행렬의 기본 이론을 소개하고, 이를 바나흐 공간 (Banach space)에서 작용하는 선형 유계 연산자 (linear bounded operators)로 해석하는 글