Training data-efficient image transformers & distillation through attention

•Download as PPTX, PDF•

0 likes•385 views

Training data-efficient image transformers & distillation through attention paper review!! youtube : https://youtu.be/Jpv-Wm8vvI4 contact : tfkeras@kakao.com

Science

2021년 1월 31일
딥러닝 논문읽기 모임
이미지 처리팀 : 김병현 박동훈 안종식 홍은기 허다운
Training data-Efficient Image transformer &
Distillation through Attention(DeiT)

Contents
Summary 01
03
02
04
05
Experience
Prerequisites
Method
Discussion

01. Summary
1. 2020년 12월 발표, Facebook AI
2. ViT를 일부 발전시키고 Distillation 개념 도입
3. Contribution
- CNN을 사용하지 않은 Image Classification
- ImageNet만으로 학습
- Single 8-GPU Node로 2~3일정도만 학습
- SOTA CNN기반 Model과 비슷한 성능 확인
- Distillation 개념 도입
4. Conclusion
- CNN 기반 Architecture들은 다년간 연구가 진행되어 성능 향상
- Image Context Task에서 Transformer는 이제 막 연구되기 시작함
> 비슷한 성능을 보여준다는 점에서 Transformer의 가능성을 보여줌

Prerequisites
02
Vision Transformer & Knowledge Distillation

02. Prerequisites
1. Vision Transformer
- An Image is Worth 16x16 words : Transformers for Image Recognition at Scale, Google
> 참조 : Deformable DETR: Deformable Transformers for End to End Object Detection paper review - 홍은기

02. Prerequisites
1. Vision Transformer
- Training Dataset : JFT-300M
- Pre-train : Low Resolution, Fine-tunning : High Resolution
> Position Embedding : Bicubic Interpolation

02. Prerequisites
2. Knowledge Distillation
- 미리 잘 학습된 Teacher Model을 작은 Student Model에 지식을 전달한다는 개념
> 참조 : Explaining knowledge distillation by quantifying the knowledge - 김동희

03. Architecture
1. Knowledge Distillation
- Class Token과 같은 구조의 Distillation Token 추가
- Soft Distillation
- Hard Distillation
- Random Crop으로 인한 잘못된 학습 방지 가능
GT : Cat / Prediction : Cat
GT : Cat / Prediction : ???

03. Architecture
2. Bag of Tricks
- 기본적으로, ViT 구조를 그대로 사용 (ViT-B = DeiT-B)
> 기본적인 학습 방법 동일
> Hyper parameter Tunning으로 성능 향상

EXPERIMENTS
04
Experiment Result of DeiT

04. Experiments
1. Distillation
- Teacher Model : RegNetY-16GF
> ConvNet is Better than Transformer Model
“Probably” Inductive Bias !
- Distillation Comparison : Hard is Better
* Inductive Bias
- Distillation Method가 Convnet의 Inductive Bias를 더 잘 학습한다

04. Experiments
2. Efficiency vs Accuracy
- Parameter의 개수, 처리속도, Accuracy를 비교
> Throughput과 Accuracy로 비교하면, Convnet와 유사한 성능을 보인다
- Base Model : DeiT-B (= ViT-B)
3. Transfer Learning
- ImageNet으로 학습한 Pre-Train Model을 다른 데이터 Set으로 Test

05. Discussion
1. Contribution
1) Transformer 기반의 ViT Model의 성능 향상 (Convnet X)
2) ViT보다 더 적은 Dataset으로 학습 및 학습속도 향상
3) SOTA Convnet과 유사한 성능 확인
4) 간편한 Knowledge Distillation 방법 제안
2. Opinion
1) 여전히 많은 Epoch 필요 (300~500Epoch)
2) Transformer의 단점이 드러남
> Hyper Parameter에 민감
> Convnet대비 많은 Dataset과 Training 시간이 필요
> 연구단계에서는 많은 연구 가능, 현업에 적용하기에는 어려움
3) Deep Learning 개발 초기단계의 연구 방식
> Quantitative Research (Experiment  Theory)
> Experiment의 결과를 충분히 해석하지 못함
3. Conclusion
1) 아직 연구가 많이 필요한 분야
2) 연구 초기단계임에도 불구하고 CNN과 유사한 성능을 나타낸다는 것은
NLP에서의 변화처럼, CNN을 대체할 수 있을 가능성을 확인할 수 있음

What's hot

CVPR2019読み会 "A Theory of Fermat Paths for Non-Line-of-Sight Shape Reconstruc...

Hajime Mihara

ViT.pptx

Changjin Lee

*A part of this slide is not completed. Instructions on forward/back propagation on a simple RNN. Supplement material of "Simple RNN: the first foothold for understanding LSTM." https://data-science-blog.com/blog/2020/06/17/simple-rnn-the-first-foothold-for-understanding-lstm/ Based on https://www.deeplearningbook.org/contents/rnn.html * I make study materials on machine learning, sponsored by DATANOMIQ. I do my best to make my content as straightforward but as precise as possible. I include all of my reference sources. If you notice any mistakes in my materials, including grammatical errors, please let me know (email: yasuto.tamura@datanomiq.de). And if you have any advice for making my materials more understandable to learners, I would appreciate hearing it.

simple_rnn_forward_back_propagation

YasutoTamura1

Laplacian Pyramid of Generative Adversarial Networks (LAPGAN) - NIPS2015読み会 #...

Koichi Hamada

A Beginner's Guide to Monocular Depth Estimation

Ryo Takahashi

Transformerを用いたAutoEncoderの設計と実験

myxymyxomatosis

이번 논문은 요즘 핫한 Diffusion을 처음으로 유행시킨 Denoising Diffusion Probabilistic Models (DDPM) 입니다. ICML 2015년에 처음 제안된 Diffusion의 여러 실용적인 측면들을 멋지게 해결하여 그 유행의 시작을 알린 논문인데요, Generative Model의 여러 분야와 Diffusion, 그리고 DDPM에서는 무엇이 바뀌었는지 알아보도록 하겠습니다. 논문 링크: https://arxiv.org/abs/2006.11239 영상 링크: https://youtu.be/1j0W_lu55nc

PR-409: Denoising Diffusion Probabilistic Models

Hyeongmin Lee

Lecture 4: Transformers (Full Stack Deep Learning - Spring 2021)

Sergey Karayev

Because of deep learning we now talk a lot about tensors, yet tensors remain relatively unknown objects. In this presentation I will introduce tensors and the basics of multilinear algebra, then describe tensor decompositions and give some examples of how they are used in representation learning for understanding/compressing data. I will also briefly describe how tensor decompositions are used in 1) the method of moments for training latent variable models, and 2) deep learning for understanding why deep convolutional networks are such excellent classifiers.

A brief survey of tensors

Berton Earnshaw

오늘 소개해 드릴 논문은 구글의 BERT와 페이스북 현재 메타의 RoBERTa를 기반으로 만들어진 모델입니다. RoBERTa + Disentangled Attention과 enhanced mask decode 두가지의 핵심 기술로 RoBERTa를 더욱 개선 시킨 모델이라고 이해하시면 될 것 같습니다. 추가적으로 Scale Invariant Fine Tuning을 도입하여 RoBERTa를 상당히 많은 테스크에서, NLU 테스크에서는 RoBERTa, BERT이상의 성능을 보여준 논문이기도 합니다. 논문의 자세한 리뷰부터, 백그라운드 지식까지, 자연어처리팀 진명훈님이 도와주셨습니다.

DeBERTA : Decoding-Enhanced BERT with Disentangled Attention

taeseon ryu

スパースモデリングによる多次元信号・画像復元

Shogo Muramatsu

BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Minh Pham

Tính toán khoa học - Chương 4: Giải phương trình phi tuyến

Chien Dang

[Paper] Multiscale Vision Transformers(MVit)

Susang Kim

PR-228: Geonet: Unsupervised learning of dense depth, optical flow and camera...

Hyeongmin Lee

The Transformer in Vision | Xavier Giro | Master in Computer Vision Barcelona...

Universitat Politècnica de Catalunya

"Attention Is All You Need" Grazie a queste semplici parole, nel 2017 il Deep Learning ha subito un profondo cambiamento. I Transformers, inizialmente introdotti nel campo del Natural Language Processing, si sono recentemente dimostrati estremamente efficaci anche al di fuori di questo settore, ottenendo un enorme - e forse inaspettato - successo nel campo della Computer Vision. I Vision Transformers e moltissime delle sue varianti stanno ridefinendo oggi lo stato dell'arte su molti task di visione artificiale, dalla classificazione di immagini fino ai sistemi di visione per la guida autonoma. Ma cosa sono i Transformers? In che cosa consiste il meccanismo della self-attention che è alla base del loro funzionamento? Quali sono i suoi limiti? Saranno in grado di rimpiazzare le famose reti convoluzionali che hanno, a loro tempo, rivoluzionato la Computer Vision? In questo talk cercheremo di rispondere a tutte queste domande, offrendo un'ampia panoramica sulle idee fondanti, sulle architetture Transformer più utilizzate, e sulle applicazioni più promettenti.

Transformers In Vision From Zero to Hero (DLI).pptx

Deep Learning Italia

State of transformers in Computer Vision

Deep Kayal

드디어 PR12 Season 4가 시작되었습니다! 제가 이번 시즌에서 발표하게 된 첫 논문은 ""NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis"라는 논문입니다. View Synthesis라는 Task는 몇 개의 시점에서 대상을 찍은 영상이 주어지면 주어지지 않은 위치와 방향에서 바라본 대상의 영상을 합성해내는 기술입니다. 이를 위해서 본 논문에서는 대상의 3D 정보를 통째로 Neural Network가 외우게 하는 방법을 선택했는데요, 이 방식은 Implicit Neural Representation이라는 이름으로 유명해지고 있는 추세고, 2D 이미지에 대해서도 적용하려는 접근들이 늘고 있습니다. 영상 링크: https://youtu.be/zkeh7Tt9tYQ 논문 링크: https://arxiv.org/abs/2003.08934

PR-302: NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis

Hyeongmin Lee

101: Convolutional Neural Networks

Mad Scientists

What's hot (20)

CVPR2019読み会 "A Theory of Fermat Paths for Non-Line-of-Sight Shape Reconstruc...

ViT.pptx

simple_rnn_forward_back_propagation

Laplacian Pyramid of Generative Adversarial Networks (LAPGAN) - NIPS2015読み会 #...

A Beginner's Guide to Monocular Depth Estimation

Transformerを用いたAutoEncoderの設計と実験

PR-409: Denoising Diffusion Probabilistic Models

Lecture 4: Transformers (Full Stack Deep Learning - Spring 2021)

A brief survey of tensors

DeBERTA : Decoding-Enhanced BERT with Disentangled Attention

スパースモデリングによる多次元信号・画像復元

BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Tính toán khoa học - Chương 4: Giải phương trình phi tuyến

[Paper] Multiscale Vision Transformers(MVit)

PR-228: Geonet: Unsupervised learning of dense depth, optical flow and camera...

The Transformer in Vision | Xavier Giro | Master in Computer Vision Barcelona...

Transformers In Vision From Zero to Hero (DLI).pptx

State of transformers in Computer Vision

PR-302: NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis

101: Convolutional Neural Networks

Similar to Training data-efficient image transformers & distillation through attention

딥러닝 논문읽기 efficient netv2 논문리뷰

taeseon ryu

I3D and Kinetics datasets (Action Recognition)

권기훈_포트폴리오

TinyBERT

History of Vision AI

PR-383: Solving ImageNet: a Unified Scheme for Training any Backbone to Top R...

Sunghoon Joo

[KR] Building modern data pipeline with Snowflake + DBT + Airflow.pdf

Chris Hoyean Song

AUTOML

승우 이

Automl

승우 이

LeNet & GoogLeNet

Institute of Agricultural Machinery, NARO

생체 광학 데이터 분석 AI 경진대회 3위 수상작

DACON AI 데이콘

위성관측 데이터 활용 강수량 산출 AI 경진대회 1위 수상작

DACON AI 데이콘

네트워크 경량화 이모저모 @ 2020 DLD

Kim Junghoon

스마트폰 위의 딥러닝

NAVER Engineering

180624 mobile visionnet_baeksucon_jwkang_pub

Jaewook. Kang

ICIP 2018 REVIEW

SungMan Cho

20년된 Naver Cafe 서비스가 Modularization으로 진화 하기_정동진.pdf

eastarJeong2

소프트웨어 마에스트로 10기 - 책을 만나는 순간, 책을찍다

HYEONGNAM LEE

딥러닝 세계에 입문하기 위반 분투

Ubuntu Korea Community

작고 빠른 딥러닝 그리고 Edge computing

StellaSeoYeonYang

Similar to Training data-efficient image transformers & distillation through attention (20)

딥러닝 논문읽기 efficient netv2 논문리뷰

I3D and Kinetics datasets (Action Recognition)

권기훈_포트폴리오

TinyBERT

History of Vision AI

PR-383: Solving ImageNet: a Unified Scheme for Training any Backbone to Top R...

[KR] Building modern data pipeline with Snowflake + DBT + Airflow.pdf

AUTOML

Automl

LeNet & GoogLeNet

생체 광학 데이터 분석 AI 경진대회 3위 수상작

위성관측 데이터 활용 강수량 산출 AI 경진대회 1위 수상작

네트워크 경량화 이모저모 @ 2020 DLD

스마트폰 위의 딥러닝

180624 mobile visionnet_baeksucon_jwkang_pub

ICIP 2018 REVIEW

20년된 Naver Cafe 서비스가 Modularization으로 진화 하기_정동진.pdf

소프트웨어 마에스트로 10기 - 책을 만나는 순간, 책을찍다

딥러닝 세계에 입문하기 위반 분투

작고 빠른 딥러닝 그리고 Edge computing

More from taeseon ryu

안녕하세요 딥러닝 논문읽기 모임 입니다! 오늘 소개할 논문은 3D관련 업무를 진행 하시는/ 희망하시는 분들의 필수 논문인 VoxelNET 입니다. 발표자료:https://www.slideshare.net/taeseonryu/mcsemultimodal-contrastive-learning-of-sentence-embeddings 안녕하세요! 딥러닝 논문읽기 모임입니다. 오늘은 자율 주행, 가정용 로봇, 증강/가상 현실과 같은 다양한 응용 분야에서 중요한 문제인 3D 포인트 클라우드에서의 객체 탐지에 대한 획기적인 진전을 소개하고자 합니다. 이를 위해 'VoxelNet'이라는 새로운 3D 탐지 네트워크에 대해 알아보겠습니다. 1. 기존 방법의 한계 기존의 많은 노력은 수동으로 만들어진 특징 표현, 예를 들어 새의 눈 시점 투영 등에 집중해 왔습니다. 하지만 이러한 방법들은 LiDAR 포인트 클라우드와 영역 제안 네트워크(RPN) 사이의 연결을 효과적으로 수행하기 어렵습니다. 2. VoxelNet의 혁신적 접근법 VoxelNet은 3D 포인트 클라우드를 위한 수동 특징 공학의 필요성을 없애고, 특징 추출과 바운딩 박스 예측을 단일 단계, end-to-end 학습 가능한 깊은 네트워크로 통합합니다. VoxelNet은 포인트 클라우드를 균일하게 배치된 3D 복셀로 나누고, 새롭게 도입된 복셀 특징 인코딩(VFE) 레이어를 통해 각 복셀 내의 포인트 그룹을 통합된 특징 표현으로 변환합니다. 3. 효과적인 기하학적 표현 학습 이 방식을 통해 포인트 클라우드는 서술적인 체적 표현으로 인코딩되며, 이는 RPN에 연결되어 탐지를 생성합니다. VoxelNet은 다양한 기하학적 구조를 가진 객체의 효과적인 구별 가능한 표현을 학습합니다. 4. 성능 평가 KITTI 자동차 탐지 벤치마크에서의 실험 결과, VoxelNet은 기존의 LiDAR 기반 3D 탐지 방법들을 큰 차이로 능가했습니다. 또한, LiDAR만을 기반으로 한 보행자와 자전거 탐지에서도 희망적인 결과를 보였습니다. VoxelNet의 도입은 3D 포인트 클라우드에서의 객체 탐지를 혁신적으로 개선하고 있으며, 이 분야에서의 미래 발전에 중요한 영향을 미칠 것으로 기대됩니다. 오늘 논문 리뷰를 위해 이미지처리 허정원님이 자세한 리뷰를 도와주셨습니다 많은 관심 미리 감사드립니다! https://youtu.be/yCgsCyoJoMg

VoxelNet

taeseon ryu

오늘은 의견 요약 분야에서의 흥미로운 발전에 대해 이야기하고자 합니다. 특히, 제품이나 장소에 대한 수백 개의 리뷰를 요약하는 것은 중요하고도 어려운 과제인데요, 최근에 이를 위한 새로운 자가학습 접근법, 'OpineSum'이 소개되었습니다. 1. 의견 요약의 중요성 일반적으로 제품이나 장소에 대한 리뷰는 많은 양으로 존재합니다. 이러한 리뷰들을 요약하는 것은 사용자가 정보를 빠르게 파악하는 데 도움을 주며, 의사결정 과정을 간소화할 수 있습니다. 2. 기존의 접근 방식과 한계 뉴스 분야에서의 추상적 요약은 수백만 개의 뉴스 기사와 함께 제공되는 인간 작성 요약을 통해 훈련된 감독 시스템에 의해 큰 진전을 보였습니다. 하지만 의견 텍스트의 경우, 이러한 대규모 데이터셋이 드물게 존재합니다. 3. OpineSum의 소개 이러한 문제를 해결하기 위해, 'OpineSum'이라는 새로운 자가학습 접근법이 제안되었습니다. 이 방법은 텍스트 함축의 새로운 응용을 사용하여 여러 리뷰에서의 의견 합의를 포착하는 요약을 구축합니다. 4. OpineSum의 작동 방식 OpineSum은 대규모에서 은근한 표준 요약을 얻을 수 있으며, 비지도 및 소수샷 추상적 요약 시스템 훈련에 사용할 수 있습니다. 이 방법은 SOTA 달성했습니다. OpineSum은 의견 요약의 새로운 지평을 열고, 대규모 데이터가 부족한 상황에서도 효과적인 요약을 생성할 수 있는 방법을 제시합니다. 이러한 발전은 의견 요약 기술의 미래에 큰 영향을 미칠 것으로 기대됩니다. 오늘 논문 리뷰를 위해 자연어 처리 변현정님이 자세한 리뷰를 도와주셨습니다 많은 관심 미리 감사드립니다! https://youtu.be/gqJCWyYPtXQ

OpineSum Entailment-based self-training for abstractive opinion summarization...

taeseon ryu

"3D Gaussian Splatting for Real-Time Radiance Field Rendering"은 고화질의 실시간 복사장 렌더링을 가능하게 하는 새로운 방법을 소개합니다. 이 방법은 혁신적인 3D 가우시안 장면 표현과 실시간 차별화 렌더러를 결합하여, 장면 최적화 및 새로운 시점 합성에서 상당한 속도 향상을 가능하게 합니다. 기존의 신경 복사장(NeRF) 방법들이 광범위한 훈련과 렌더링 자원을 요구하는 문제에 대한 해결책을 제시하며, 1080p 해상도에서 실시간 성능과 고품질의 새로운 시점 합성을 위해 설계되었습니다. 이는 이전 방법들에 비해 효율성과 품질 면에서 진보를 이루었습니다

3D Gaussian Splatting

taeseon ryu

JetsonTX2 Python

taeseon ryu

이 논문은 컴퓨터 비전 작업, 예를 들면 이미지 분류, 검색 및 몇 번의 학습과 같은 작업에서의 하이퍼볼릭 임베딩의 사용에 대해 논의합니다. 저자들은 이미지 간의 계층적 관계를 임베딩하는 데 하이퍼볼릭 공간이 더 적합하다고 주장하며, 이러한 관계는 컴퓨터 비전 작업에서 흔히 볼 수 있습니다. 그들은 데이터셋의 초계성을 평가하는 방법을 제안하고, 하이퍼볼릭 임베딩이 이미지 분류와 몇 번의 학습을 위해 사용되는 표준 아키텍처의 성능을 향상시킬 수 있다고 보여줍니다. 또한, 이 논문은 하이퍼 볼릭 공간과 하이퍼볼릭 추정에 대한 기억을 상기시켜 줍니다.

Hyperbolic Image Embedding.pptx

taeseon ryu

이 논문은 MCSE라는 새로운 접근법을 제시하며, 시각과 텍스트 정보를 결합하여 의미있는 문장 임베딩을 학습합니다. 다양한 데이터셋과 사전 훈련된 인코더에서 성능 향상을 보이며, 의미론적으로 유사한 문장을 잘 정렬합니다. 또한, 비전을 추가 의미 정보로 사용함으로써 문장 표현 학습을 더욱 촉진할 수 있다는 주장을 하고 있습니다. 이 방법은 기존의 문장 임베딩 학습 방법과 비교되며, 그 결과로서 이론과 실제에서 모두 탁월한 성능을 보입니다.

MCSE_Multimodal Contrastive Learning of Sentence Embeddings_변현정

taeseon ryu

LLaMA Open and Efficient Foundation Language Models - 230528.pdf

taeseon ryu

이 논문은 데이터셋 디스틸레이션에 대한 새로운 접근법을 제안합니다. 데이터셋 디스틸레이션은 전체 데이터셋에서 학습된 모델의 테스트 정확도를 일치시킬 수 있는 작은 데이터셋을 합성하는 작업입니다. 제안된 방법은 디스틸레이션 데이터를 최적화하여 실제 데이터로 학습된 네트워크와 유사한 상태로 이끌어냅니다. 이 방법은 기존 방법들을 능가하며, 더 높은 해상도의 시각 데이터를 디스틸레이션할 수 있게 합니다. 데이터셋 디스틸레이션은 지속적인 학습, 신경 아키텍처 검색, 개인정보 보호 ML 등 다양한 응용 분야가 있습니다.

YOLO V6

taeseon ryu

Dataset Distillation by Matching Training Trajectories

taeseon ryu

이 논문은 강화 학습(Reinforcement Learning, RL)을 감독 학습(Supervised Learning, SL)의 형태로 변환하는 새로운 접근법을 제안합니다. 이를 'Upside Down RL (UDRL)'이라 부릅니다. 표준 RL은 보상을 예측하는 반면, UDRL은 보상을 작업 정의 입력으로 사용하며, 시간 지향성과 기타 계산 가능한 함수를 이력 데이터와 원하는 미래 데이터에 적용합니다. UDRL은 이러한 입력 관찰을 명령으로 해석하고, 과거 경험에 대한 SL을 통해 이를 행동(또는 행동 확률)에 매핑하여 학습합니다. UDRL은 높은 보상이나 다른 목표를 달성하기 위해 일반화하며, 이는 "주어진 시간 내에 많은 보상을 얻으라!"와 같은 입력 명령을 통해 이루어집니다. 또한 UDRL은 탐색 전략을 개선하는 방법을 배울 수 있습니다. 별도의 논문에서는 UDRL의 초기 버전이 특정 강화 학습 문제에서 전통적인 기준 알고리즘을 능가할 수 있다는 것을 보여줍니다. 이 논문은 또한 로봇이 사람을 모방하는 방법을 가르치는 접근법을 개념적으로 단순화합니다. 먼저 로봇의 현재 행동을 모방하는 사람들을 비디오로 촬영한 다음, 로봇이 이 비디오(입력 명령으로)를 이러한 행동에 매핑하는 방법을 SL을 통해 학습하게 합니다. 그런 다음 로봇은 일반화하고 이전에 알려지지 않은 행동을 실행하는 사람들의 비디오를 모방하게 됩니다. 오늘 논문 리뷰를 위해 강화학습 이도현님이 자세한 리뷰를 도와주셨습니다 많은 관심 미리 감사드립니다! https://youtu.be/bsBvKdKCc1E

RL_UpsideDown

taeseon ryu

핵심 키워드 Packed Levitated Markers (PL-Marker) Neighborhood-oriented packing strategy: Subject-oriented packing strategy 지금까지 발표한 논문 :https://github.com/Lilcob/-DL_PaperReadingMeeting 발표자료 : https://www.slideshare.net/taeseonryu/morel-modelbased-offline-reinforcement-learning 이 논문은 새로운 개체 및 관계 추출 방법인 Packed Levitated Markers (PL-Marker)에 초점을 맞추고 있습니다. PL-Marker는 인코더 내에서 전략적으로 마커를 패킹하여 스팬 간의 상호 관계를 고려합니다. 논문에서는 이웃 중심 패킹 전략과 주제 중심 패킹 전략 두 가지를 제시합니다. 이러한 전략들은 개체 경계 정보와 동일 주제 스팬 쌍 간의 상호 관계를 더 잘 모델링하도록 설계되었습니다. 실험 결과는 제안된 접근법의 효과를 보여줍니다. PL-Marker는 6개의 Named Entity Recognition (NER) 벤치마크에서 이전의 최첨단 모델들을 능가합니다. 오늘 논문 리뷰를 위해 자연어 처리 김유진님이 자세한 리뷰를 도와주셨습니다 많은 관심 미리 감사드립니다! https://youtu.be/aiS_iNOOUl8

Packed Levitated Marker for Entity and Relation Extraction

taeseon ryu

오늘 소개할 논문은 'MOReL: Model-Based Offline Reinforcement Learning'입니다. 이 논문은 오프라인 강화 학습(Reinforcement Learning, RL)에 초점을 맞추고 있습니다. 오프라인 RL은 행동 정책을 개선하기 위해 사전에 수집된 데이터만을 사용하는 학습 방법입니다. 이 논문에서는 MOReL이라는 새로운 알고리즘 프레임워크를 제시하며, 이는 오프라인 RL을 위한 것입니다. MOReL은 두 단계로 구성되어 있습니다: 첫째, 오프라인 데이터셋을 사용하여 비관적인 MDP(Model-based Decision Process)를 학습하고, 둘째, 이 P-MDP에서 거의 최적의 정책을 학습합니다. 학습된 P-MDP는 정책 평가와 학습에 대한 좋은 대리자 역할을 하며, 모델 기반 RL의 일반적인 함정인 모델 활용을 극복합니다. 이 논문에서는 MOReL이 오프라인 RL에 대해 최소최대 최적(minimax optimal)이며, 널리 연구된 벤치마크에서 최첨단 성능을 달성함을 보여줍니다. 또한, 이 논문은 오프라인 RL의 중요한 문제인 행동 정책의 안전성에 대한 중요한 통찰력을 제공합니다. 이 논문은 오프라인 강화 학습의 새로운 접근법을 제시하며, 이를 통해 더 효율적인 방식으로 다양한 강화 학습 작업에 대한 성능을 향상시킬 수 있음을 보여줍니다.

MOReL: Model-Based Offline Reinforcement Learning

taeseon ryu

이 논문은 언어 모델에 대한 fine tuning하는 방법에 대해 탐구하고 있습니다. 특히, 작업의 수, 모델 크기, 그리고 체인-오브-소트 데이터를 확장하는 것에 초점을 맞추고 있습니다. 결과적으로, 다양한 모델 클래스와 평가 벤치마크에서 보이는 성능과 미처 보지 못한 작업에 대한 일반화에 있어서 상당한 향상을 보여줍니다. 이 논문은 또한, 강력한 few-shot 성능을 달성하는 Flan-T5 체크포인트를 공개합니다. 지시사항 미세조정은 사전 훈련된 언어 모델의 성능과 사용성을 향상시키는 일반적인 방법입니다. 이 논문은 언어 모델의 미세조정에 대한 새로운 접근법을 제시하며, 이를 통해 더 효율적인 방식으로 다양한 언어 작업에 대한 성능을 향상시킬 수 있음을 보여줍니다. 오늘 논문 리뷰를 위해 자연어처리 박산희님이 자세한 리뷰를 도와주셨습니다 많은 관심 미리 감사드립니다! https://youtu.be/lta-rKYtVbg

Scaling Instruction-Finetuned Language Models

taeseon ryu

Visual Prompt Tuning (VPT),Parameter-efficient fine-tuning 지금까지 발표한 논문 :https://github.com/Lilcob/-DL_PaperReadingMeeting 발표자료 : https://www.slideshare.net/taeseonryu/mplug 안녕하세요 딥러닝 논문읽기 모임 입니다! 오늘 소개 드릴 논문은 'Visual Prompt Tuning for Transformers with Frozen Weights' 입니다. 오늘 소개하는 논문은 대규모 Transformer 모델을 비전에 효율적이고 효과적으로 미세조정하는 대안인 Visual Prompt Tuning (VPT)를 소개하고 있습니다. VPT는 입력 공간에서 작은 양의 훈련 가능한 매개변수를 도입하면서 모델 백본을 고정합니다. 이 방법을 통해, VPT는 다른 매개변수 효율적인 튜닝 프로토콜에 비해 상당한 성능 향상을 달성하며, 많은 경우에는 전체 미세조정을 능가하면서 작업당 저장 비용을 줄인다는 것을 실험적으로 보여줍니다. 이 논문은 효과성과 효율성 면에서 대규모 사전 훈련된 Transformer를 하위 작업에 적용하는 도전을 다룹니다. 이를 통해, 더 효율적인 방식으로 다양한 비전-언어 작업에 대한 성능을 향상시킬 수 있음을 보여줍니다. 오늘 논문 리뷰를 위해 이미지처리 조경진님이 자세한 리뷰를 도와주셨습니다 많은 관심 미리 감사드립니다! https://youtu.be/bVOk-hSYyZw

Visual prompt tuning

taeseon ryu

오늘 영상에서 소개된 논문은 Alibaba의 DAMO Academy가 개발한 새로운 비전-언어 기반 모델인 mPLUG입니다. mPLUG는 cross-modal skip-connections을 사용하여 기존의 사전 훈련된 모델에서 나타나는 계산 효율성이 낮고 정보 불균형 문제를 해결합니다. mPLUG는 이미지 캡셔닝, 이미지-텍스트 검색, 시각적 그라운딩, 시각적 질문 응답 등 다양한 비전-언어 하위 작업에서 최첨단 결과를 보여줍니다. 또한, 다수의 비디오-언어 작업에 직접 전환할 때 강력한 제로샷 전이성을 보여줍니다.

mPLUG

taeseon ryu

Train중 예상 Return 을 최대화하기 위해 알려지지 않은 환경에서 '탐색'과 '활용' 사이의 균형을 잘 이루는 것이 중요합니다. 이를 이상적으로 수행하는 '베이즈 최적 정책'은 환경 상태뿐만 아니라 에이전트가 환경에 대해 느끼는 불확실성에 따라 행동을 결정합니다. 하지만, 베이즈 최적 정책을 계산하는 것은 작은 작업들에 대해서조차 까다롭습니다. 이 논문에서는, 알려지지 않은 환경에서 근사적으로 추론을 수행하고, 그 불확실성을 행동 선택 과정에 직접 포함시키는 방법, 'variational Bayes-Adaptive Deep RL' (variBAD)를 소개합니다.

variBAD, A Very Good Method for Bayes-Adaptive Deep RL via Meta-Learning.pdf

taeseon ryu

논문에서는 최적화 컴파일러에서 신경망 연산 그래프의 실행 비용을 최소화하는 깊은 강화 학습 방법을 제시합니다. 이전의 학습 기반 작업들은 최적화될 동일한 그래프에서 최적화기를 훈련하는 것이 필요했지만, 논문은 오프라인에서 최적화기를 훈련하고 이후에는 추가 훈련 없이 이전에 보지 못한 그래프에 일반화하는 학습 접근법을 제안합니다. 이를 통해 논문의 방법은 시간 대신 초 단위로 실제 세계의 텐서플로우(TensorFlow) 그래프에서 고품질의 실행 결정을 생성할 수 있습니다. 논문은 연산 그래프에 대한 두 가지 최적화 작업을 고려합니다: 실행 시간과 최대 메모리 사용량을 최소화하는 것입니다. 광범위한 기준 세트에 비해, 우리의 접근법은 이 두 가지 작업에서 고전적인 방법과 다른 학습 기반 방법에 비해 상당한 개선을 보여줍니다.

Reinforced Genetic Algorithm Learning For Optimizing Computation Graphs.pdf

taeseon ryu

이 논문은 신경망 학습에 대한 새로운 방법을 제시하는데, 이 방법의 이름은 'Forward-Forward 알고리즘'입니다. 기존의 딥러닝 방법은 데이터를 앞으로 보내고 결과를 다시 뒤(backward)로 보내는 '앞-뒤' 방식인데, 이 새로운 방법은 '앞-앞' 방식을 사용하니까 'Forward-Forward'라고 부릅니다. 이 알고리즘에서는 '양의 데이터'와 '부정적인 데이터' 두 종류를 사용합니다. '양의 데이터'는 실제로 우리가 가진 정보를 의미하고, '부정적인 데이터'는 신경망이 스스로 생성하는 정보를 말합니다. 이 두 종류의 데이터를 각각 앞으로 보내서, 각 계층이 '양의 데이터'에 대해는 좋은 결과를, '부정적인 데이터'에 대해는 나쁜 결과를 내도록 학습합니다. 핵심은 신경망의 학습 방법에 변화를 주어, 더 효율적이고 간편하게 학습을 진행할 수 있도록 한다는 점입니다. 이 방법을 사용하면 비디오 같은 데이터를 신경망을 통해 처리하면서 복잡한 연산을 중단하거나 데이터를 저장할 필요 없이 진행할 수 있다는 것이 큰 장점입니다.

The Forward-Forward Algorithm

taeseon ryu

활성 학습(Active Learning, AL)은 대량의 라벨이 없는 데이터를 처리하고, 데이터 라벨링 비용이 지나치게 높은 영역에서 이를 줄이는데 유망한 머신러닝 패러다임입니다. 최근에 제안된 신경망 기반의 활성 학습 방법들은 이 목표를 달성하기 위해 다양한 휴리스틱을 사용합니다. 이 연구에서는 동일한 실험 조건 하에서, 다른 종류의 활성 학습 알고리즘들(불확실성 기반, 다양성 기반, 커미티 기반)이 무작위 샘플링 기준에 비해 일관성 없는 향상을 보이는 것을 보여줍니다. 다양한 실험을 통해, 확률적 요인을 제어하면서, 활성 학습 알고리즘들이 달성하는 성능 지표의 변동성이 이전에 보고된 결과와 일치하지 않는 결과를 가져올 수 있음을 보여줍니다

Towards Robust and Reproducible Active Learning using Neural Networks

taeseon ryu

이 논문에서는 추상적 요약 모델의 훈련 방식에 대해 논의하고 있습니다. 일반적으로 이러한 모델은 최대 가능도 추정을 사용하여 훈련되는데, 이는 이상적인 모델이 모든 확률 질량을 참조 요약에 할당할 것이라고 가정하는 결정론적인 목표 분포를 가정합니다. 이런 가정은 추론 과정에서 성능 저하를 초래할 수 있는데, 모델이 참조 요약에서 벗어난 여러 후보 요약을 비교해야 하기 때문입니다. 이 문제를 해결하기 위해, 저자들은 서로 다른 후보 요약들이 그들의 품질에 따라 확률 질량을 할당받는 비결정론적 분포를 가정하는 새로운 훈련 패러다임을 제안합니다. 이 방법은 CNN/DailyMail (47.78 ROUGE-1) 및 XSum (49.07 ROUGE-1) 데이터셋에서 새로운 최고 성능을 달성했습니다.

BRIO: Bringing Order to Abstractive Summarization

taeseon ryu

More from taeseon ryu (20)

VoxelNet

OpineSum Entailment-based self-training for abstractive opinion summarization...

3D Gaussian Splatting

JetsonTX2 Python

Hyperbolic Image Embedding.pptx

MCSE_Multimodal Contrastive Learning of Sentence Embeddings_변현정

LLaMA Open and Efficient Foundation Language Models - 230528.pdf

YOLO V6

Dataset Distillation by Matching Training Trajectories

RL_UpsideDown

Packed Levitated Marker for Entity and Relation Extraction

MOReL: Model-Based Offline Reinforcement Learning

Scaling Instruction-Finetuned Language Models

Visual prompt tuning

mPLUG

variBAD, A Very Good Method for Bayes-Adaptive Deep RL via Meta-Learning.pdf

Reinforced Genetic Algorithm Learning For Optimizing Computation Graphs.pdf

The Forward-Forward Algorithm

Towards Robust and Reproducible Active Learning using Neural Networks

BRIO: Bringing Order to Abstractive Summarization

Training data-efficient image transformers & distillation through attention

1. 2021년 1월 31일 딥러닝 논문읽기 모임 이미지 처리팀 : 김병현 박동훈 안종식 홍은기 허다운 Training data-Efficient Image transformer & Distillation through Attention(DeiT)

2. Contents Summary 01 03 02 04 05 Experience Prerequisites Method Discussion

3. Summary 01 Summary of DeiT

4. 01. Summary 1. 2020년 12월 발표, Facebook AI 2. ViT를 일부 발전시키고 Distillation 개념 도입 3. Contribution - CNN을 사용하지 않은 Image Classification - ImageNet만으로 학습 - Single 8-GPU Node로 2~3일정도만 학습 - SOTA CNN기반 Model과 비슷한 성능 확인 - Distillation 개념 도입 4. Conclusion - CNN 기반 Architecture들은 다년간 연구가 진행되어 성능 향상 - Image Context Task에서 Transformer는 이제 막 연구되기 시작함 > 비슷한 성능을 보여준다는 점에서 Transformer의 가능성을 보여줌

5. Prerequisites 02 Vision Transformer & Knowledge Distillation

6. 02. Prerequisites 1. Vision Transformer - An Image is Worth 16x16 words : Transformers for Image Recognition at Scale, Google > 참조 : Deformable DETR: Deformable Transformers for End to End Object Detection paper review - 홍은기

7. 02. Prerequisites 1. Vision Transformer - Training Dataset : JFT-300M - Pre-train : Low Resolution, Fine-tunning : High Resolution > Position Embedding : Bicubic Interpolation

8. 02. Prerequisites 2. Knowledge Distillation - 미리 잘 학습된 Teacher Model을 작은 Student Model에 지식을 전달한다는 개념 > 참조 : Explaining knowledge distillation by quantifying the knowledge - 김동희

9. Q & A

10. Architecture 03 Implement of DeiT

11. 03. Architecture 1. Knowledge Distillation - Class Token과 같은 구조의 Distillation Token 추가 - Soft Distillation - Hard Distillation - Random Crop으로 인한 잘못된 학습 방지 가능 GT : Cat / Prediction : Cat GT : Cat / Prediction : ???

12. 03. Architecture 2. Bag of Tricks - 기본적으로, ViT 구조를 그대로 사용 (ViT-B = DeiT-B) > 기본적인 학습 방법 동일 > Hyper parameter Tunning으로 성능 향상

13. Q & A

14. EXPERIMENTS 04 Experiment Result of DeiT

15. 04. Experiments 1. Distillation - Teacher Model : RegNetY-16GF > ConvNet is Better than Transformer Model “Probably” Inductive Bias ! - Distillation Comparison : Hard is Better * Inductive Bias - Distillation Method가 Convnet의 Inductive Bias를 더 잘 학습한다

16. 04. Experiments 2. Efficiency vs Accuracy - Parameter의 개수, 처리속도, Accuracy를 비교 > Throughput과 Accuracy로 비교하면, Convnet와 유사한 성능을 보인다 - Base Model : DeiT-B (= ViT-B) 3. Transfer Learning - ImageNet으로 학습한 Pre-Train Model을 다른 데이터 Set으로 Test

17. Discussion 05 Conclusion & Discussing

18. 05. Discussion 1. Contribution 1) Transformer 기반의 ViT Model의 성능 향상 (Convnet X) 2) ViT보다 더 적은 Dataset으로 학습 및 학습속도 향상 3) SOTA Convnet과 유사한 성능 확인 4) 간편한 Knowledge Distillation 방법 제안 2. Opinion 1) 여전히 많은 Epoch 필요 (300~500Epoch) 2) Transformer의 단점이 드러남 > Hyper Parameter에 민감 > Convnet대비 많은 Dataset과 Training 시간이 필요 > 연구단계에서는 많은 연구 가능, 현업에 적용하기에는 어려움 3) Deep Learning 개발 초기단계의 연구 방식 > Quantitative Research (Experiment  Theory) > Experiment의 결과를 충분히 해석하지 못함 3. Conclusion 1) 아직 연구가 많이 필요한 분야 2) 연구 초기단계임에도 불구하고 CNN과 유사한 성능을 나타낸다는 것은 NLP에서의 변화처럼, CNN을 대체할 수 있을 가능성을 확인할 수 있음

19. Q & A

20. THANK YOU for Watching

Training data-efficient image transformers & distillation through attention

Recommended

Recommended

More Related Content

What's hot

What's hot (20)

Similar to Training data-efficient image transformers & distillation through attention

Similar to Training data-efficient image transformers & distillation through attention (20)

More from taeseon ryu

More from taeseon ryu (20)

Training data-efficient image transformers & distillation through attention