전체 글
-
표현 학습(representation learning) 방법론 정리 — SSL, self distillation, contrastive learningMachine Learning 2026. 5. 21. 18:48
참고 글 : https://jungheeho.tistory.com/115 [Paper Review] emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation논문: Ma et al., emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation, ACL 2024 Findings 저자 소속: 상하이교통대, 푸단대, 홍콩중문대, Alibaba arXiv: 2312.15185 · 코드: github.com/ddlBoJack/emotion2vec 음성에jungheeho.tistory.com 음성·이미지·텍스트를 다루는 딥러닝 모델을 공부하다 보면 represen..
-
[Paper Review] emotion2vec: Self-Supervised Pre-Training for Speech Emotion RepresentationPaper Review🧾 2026. 5. 21. 16:13
논문: Ma et al., emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation, ACL 2024 Findings 저자 소속: 상하이교통대, 푸단대, 홍콩중문대, Alibaba arXiv: 2312.15185 · 코드: github.com/ddlBoJack/emotion2vec 음성에서 감정을 읽어내는 일은 생각보다 까다롭다. 같은 "괜찮아"라는 한 마디도 톤에 따라 안심일 수도, 체념일 수도 있다. emotion2vec은 이 문제를 정면으로 다룬 모델로, "speech emotion recognition을 위한 universal representation model"을 표방한다. 이 글에서는 논문이 무엇을 풀려 했고, 어..
-
NVIDIA RTX 50 시리즈 (5080·5090) 유저 필독: 2026년 PyTorch·CUDA·FlashAttention 최종 정리(Blackwell)Dev🚀 2026. 1. 30. 19:26
이 글은 아래 기준을 만족하는 독자를 대상으로 합니다.- RTX 50xx (5070/5080/5090) GPU 사용자- PyTorch stable 환경을 사용하고 싶은 개발자/연구자- nightly 없이 CUDA / FlashAttention을 쓰고 싶은 경우요약RTX 50xx시리즈는 NVIDIA Blackwell 아키텍처 기반 GPU로 Compute Capability 12.0(SM120)을 사용한다. 출시 초기에는 PyTorch stable 릴리즈 및 주요 CUDA 확장 라이브러리들이 SM120을 포함해 빌드되지 않아 정상 사용이 어려웠다. PyTorch 2.7.0(2025년 4월)부터 CUDA 12.8 기반 stable wheel에 Blackwell(SM120) 지원이 포함되었으며, 2026년 기준..
-
AI최적화: AI 관제 기술의 세대교체: Computer Vision에서 Vision-Language Model로(3)Etc 2025. 11. 13. 13:47
1️⃣ 컴퓨터비전의 한계 — “더 이상 진전이 없다”지난 10년간 AI 관제 분야(교통, 보안, 산업 등)는 Computer Vision(CV) 기술 위에 서 있었다.차량을 감지하고, 사람을 추적하고, 물체를 분류하는 모든 기술이 여기에 기반했다.하지만 2025년 현재, 업계 내부에서는 이런 말이 나온다.“컴퓨터비전은 끝났다.”이는 과장이 아니라, 실제 현장에서 느껴지는 현실이다.노타 CTO를 포함한 여러 발표자들이 공통적으로 언급한 이유는 두 가지다.2️⃣ 한계 ① 데이터 디펜던시 — “없는 사건은 학습시킬 수 없다”컴퓨터비전은 데이터 기반 학습 구조이기 때문에,**“존재하지 않는 사건”**을 학습시킬 수 없다.예를 들어,ITS(지능형 교통시스템) 분야에서는 **‘사고 감지 속도’**가 매우 중요한 지..
-
AI 반도체의 역설 ‘NPU는 놀고, CPU만 일한다?’ (2) | SK AI Summit 2025Etc 2025. 11. 13. 13:42
1️⃣ AI 반도체의 역설 — 성능은 높아졌지만 효율은 떨어진다AI 반도체 시장은 지금 그 어느 때보다 뜨겁다. 수많은 기업들이 “GPU 이후의 대안”을 찾으며 NPU, ASIC, Edge AI 칩을 쏟아내고 있다.하지만 현장의 이야기는 조금 다르다. 최신 반도체를 도입해도 “모델이 제대로 돌아가지 않는다”는 불만이 곳곳에서 나온다. 대표적인 예로, ARM 기반 NPU를 사용하는 한 기업에서는 최신 Vision Transformer(ViT) 모델을 돌렸지만 실제 연산은 CPU에서만 일어났다. AI 효율화를 위해 NPU를 샀는데, 정작 NPU는 유휴 상태였던 것이다. 이 문제는 단순한 설정 실수가 아니라, AI 모델과 반도체 아키텍처 간 구조적 불일치에서 비롯된다.2️⃣ 왜 이런 문제가 생기나 — 모델 구..
-
AI 최적화: 경량화에서 추론까지 — End-to-End AI 최적화 인프라 플랫폼(1) | SK AI Summit 2025Etc 2025. 11. 13. 02:32
1️⃣ AI 생태계의 현실: 늘어나는 학습비용, 줄어드는 추론비용 발표의 서두는 “AI 모델의 학습비용은 기하급수적으로 늘고, 추론비용은 상대적으로 낮아지고 있다”는 문제의식으로 시작됐다. 왼쪽 그래프를 보면 GPT 시리즈, Gemini 등 대형 모델을 ‘굽는(Train)’ 데 들어가는 비용이 수억~수천억 원 수준에 달한다. 즉, 이제는 모델 하나가 아니라, Agentic AI 시스템 전체 — 즉 모델을 감싸는 운영·관리·추론·에이전트 생태계까지 포함된 거대한 투자가 필요하다. 반면, 오른쪽 그래프는 GPT·Claude·Gemini 등 주요 API들의 추론 단가(토큰당 비용) 변화를 보여준다. 2022~2025년 사이 단가는 1/10 이하로 떨어졌지만, 실제 서비스에서는 오히려 소비되는 토큰량이 폭증하면..
-
[논문리뷰] A CNN-RNN Combined Structure for Real-World Violence Detection in Surveillance CamerasPaper Review🧾 2025. 10. 1. 16:04
📌 논문 개요이 논문은 감시 영상(surveillance video)에서 폭력 및 이상행동을 자동 탐지하기 위해, CNN(ResNet50)과 RNN(ConvLSTM)을 결합한 구조를 제안한다.핵심 아이디어는 프레임별 공간적 특징(ResNet50)과 시간적 패턴(ConvLSTM)을 동시에 학습함으로써, 기존 3D CNN 기반 모델(C3D)보다 더 효율적이고 정확한 이상 탐지를 달성하는 것이다. I. Introduction(1) 왜 어려운가?감시 카메라 모니터링은 인간이 직접 하기에는 시간·비용 소모가 크고 집중력 한계로 인해 놓치는 경우가 많다.이상행동 데이터셋 자체도 희소성이 높고, 동일한 행동이라도 상황·장소에 따라 정상/비정상 여부가 달라진다(예: 사격 → 사격장 vs 길거리).(2) 기존 방법의 ..
-
[논문리뷰] Anomaly detection in surveillance videos using transformer based attention modelPaper Review🧾 2025. 9. 30. 17:29
논문 개요이 논문은 감시 영상에서 이상행동(anomaly)을 탐지하기 위해, 약지도 학습(weakly supervised learning) 기반의 접근법을 제안한다.놀라운 점은 이 모델이 프레임 단위 라벨 없이도 학습할 수 있다는 것이다. 즉, "이 영상에는 이상행동이 있다"는 정도의 라벨만 있어도, 어떤 순간에 이상이 있었는지를 프레임 단위로 예측해낸다.핵심 아이디어는 frame-level annotation 없이도 video-level label만을 사용하여 세밀한 frame-level anomaly score를 추정하는 것이다.I. Introduction(1) 이상행동 감지는 왜 어려울까?감시 시스템에서의 이상행동 탐지는 여전히 많은 시간과 인력을 요구한다. 특히, 영상의 프레임 단위로 수작업 라벨..