DL in NLP

Forwarded from I

Встречаемся завтра в 12 в ШАДе. Аудитория "Оксфорд".

Вместе с коллегами разберем статьи:
- @AllokyOfficial - https://arxiv.org/abs/1801.04871
- @PaGul - https://arxiv.org/abs/1905.08743
- @artli - https://arxiv.org/abs/1810.09587v1
- @twlvth - https://arxiv.org/abs/1907.00883

А @daLime постарается записать.

Если есть вопросы, то пишите -- помогу.

1.54K views17:17

DL in NLP

Channel photo updated

05:53

DL in NLP

SkynetToday интересно ваше мнение насчёт основных DO и DON’T в AI-новостях.

twitter.com/skynet_today/status/1162814692676423680

Прямая ссылка на форму: forms.gle/kx7fLJABetEUnQw59

Twitter

Skynet Today 🤖

AI researchers of Twitter, we need your help! We're working on a piece called "Best Practices for AI Journalism" and want to hear what you think are the top DOs and DON'Ts for media reporting on AI. Complete this survey or reply with your thoughts! https…

1.54K views08:26

👍 1

DL in NLP

Хороший обзор современного состояния transfer learning в NLP от Рудера

ruder.io/state-of-transfer-learning-in-nlp/

ruder.io

The State of Transfer Learning in NLP

This post expands on the NAACL 2019 tutorial on Transfer Learning in NLP. It highlights key insights and takeaways and provides updates based on recent work.

1.74K views18:26

👍 7

DL in NLP

NVIDIA раздаёт стипендии.

blogs.nvidia.com/blog/2019/08/16/graduate-fellowship-awards

TL;DR

Up to $50,000 per student.
We’re looking for students who have completed their first year of Ph.D.-level studies at the time of application. Applicants must also be investigating innovative ways to use GPUs. The deadline for submitting applications is Sept. 13, 2019. An internship at NVIDIA preceding the fellowship year is now mandatory — eligible candidates should be available for the internship in summer 2020.

NVIDIA Blog

Applications Open for $50,000 NVIDIA Graduate Fellowship Awards

We’re taking applications for the 19th annual NVIDIA Graduate Fellowship Program, seeking students doing outstanding GPU-based research.

2.01K views21:28

💵 13

DL in NLP

DeepMind выпускает подкаст. Пока что доступен только трейлер, но stay tuned. podcasts.apple.com/ru/podcast/deepmind-the-podcast/id1476316441?l=en

Вышли первые эпизоды 🎉

1.86K views19:41

DL in NLP

Всем привет!
Кто-то из вас уже знает, что не так давно я закончил свою работу в iPavlov, чтобы начать PhD в massachusetts.edu. В последние несколько дней было мало постов по причине переезда, что я планирую исправить в ближайшее время.
Сейчас для канала готовится новый логотип, плюс новости будут поститься в чуть-чуть другое время из-за разницы в часовых поясах.

Несколько людей простили меня рассказать, как происходило поступление в штаты, получение визы, поиск проживания и первые дни. Наверное, будет не очень хорошо запихивать всё это в один пост, так что разобью на 3-4 части и опубликую их в течение этих выходных.
Всё-таки я не позиционирую этот канал как мой личный, поэтому будет правильным спросить у вас, место ли такому материалу в канале.

1.48K views08:26

👍 216 👎

DL in NLP

И первый пост.

telegra.ph/CHast-1-Postuplenie-08-24

Telegraph

Часть 1. Поступление.

Поступить в штаты хотел давно и слышал, что на graduate-программах лучше всего в начале найти себе научрука, а дальше он поможет (спойлер, примерно так и получилось). Однако в сентябре (а осенью уже пора подавать документы в университеты США) я решил, что…

1.65K views14:04

👍 35

DL in NLP

У FAIR неплохой блог, в нём можно почитать объяснения некоторых их статей простым языком.
Например, тут описываются две их статьи:
ai.facebook.com/blog/making-transformer-networks-simpler-and-more-efficient

Adaptive Attention Span in Transformers (arxiv.org/abs/1905.07799)
и
Augmenting Self-attention with Persistent Memory (arxiv.org/abs/1907.01470)

за наводку на пост спасибо @ibelyalov

Facebook

Making Transformer networks simpler and more efficient

Facebook AI researchers are sharing an all-attention layer to simplify the Transformer model and an adaptive attention span method to make it more efficient. Even with a much simpler architecture, these methods match or improve state-of-the-art results.

1.69K viewsedited 16:40

DL in NLP

И, внезапно, статья в их блоге как раз про тему моей магистерской.
Векторные представления слов с опечатками. Правда facebook делают это supervised, что хорошо, но датасеты с исправленными опечатками пока что найти довольно сложно.

ai.facebook.com/blog/-a-new-model-for-word-embeddings-that-are-resilient-to-misspellings-

Facebook

A new model for word embeddings that are resilient to misspellings

Misspelling Oblivious Embeddings (MOE) is a new model for word embeddings that are resilient to misspellings, improving the ability to apply word embeddings to real-world situations, where misspellings are common.

1.78K views16:45

DL in NLP

На выходных совсем не было времени на обещанные посты, но вот хотя бы второй.

telegra.ph/CHast-2-Poluchenie-biznes-vizy-i-pervyj-vizit-v-SSHA-08-27

Telegraph

Часть 2. Получение бизнес-визы и первый визит в США.

Все посты: Часть 1. Поcтупление Часть 2. Получение бизнес-визы и первый визит в США Часть 3. Студенческая виза и переезд Часть 4. Что нужно успеть в первые недели PhD В прошлой части я рассказал про то, как прошёл мой процесс поступления на PhD в США. В этой…

1.63K views08:26

👍 32

DL in NLP

The HSIC Bottleneck: Deep Learning without Back-Propagation
Kurt Ma et al. Victoria University of Wellington
arxiv.org/abs/1908.01580v1

TL;DR by @vaklyuenkov
Предлагается метод обучения полносвязных и свёрточных сетей
- без обратного распространения ошибки
- без затухающих и взрывающихся градиентов
- позволяющий независимое (в тч параллельное) обучение слоёв
- требующий меньшее число операций
- результаты на бенчмарках MNIST/FashionMNIST/CIFAR10 сравнимы с обучением с обратым распространием
- биологичнее, чем backprop

Вся магия в критерии независимости Гильберта-Шмидта (HSIC) - меры, которая позволяет измерять степень независимости (что сильнее отсутсвия корреляции) между двумя многомерными случайными величинами, такими как парамметры любого скрытого слоя и ожидаемые лейблы на выходе. С помощью критерия для слоёв независимо оптимизируется баланс между независимостью от лишней информации в инпуте, ведущей к переобучению, и зависимости с желаемым результатом на выходе. Скорость сходимости получается даже больше чем у методов с backprop. Для получения state-of-the-art результатов всё-таки обучается один слой посредсвом SGD и авторы с гордостью отмечают это обходится без backprop.

It is more biologically plausible
без гмо и усилителей вкуса
всё натуральное

1.89K views15:54

👍 22

DL in NLP

1.49K views15:54

DL in NLP

OpenGPT-2: We Replicated GPT-2 Because You Can Too
ссылка

We demonstrate that many of the results of the paper can be replicated by two masters students, with no prior experience in language modeling and if you have $50K прим ред.

В статье много подробностей о подготовке датасета, на которые интересно обратить внимание (правда они теперь не такие релевантные, тк датасет от OpenAI уже доступен).

Medium

OpenGPT-2: We Replicated GPT-2 Because You Can Too

By Aaron Gokaslan* and Vanya Cohen*

1.47K views16:57

👍 5

DL in NLP

Третий пост серии про моё поступление

Telegraph

Часть 3. Студенческая виза и переезд

Все посты: Часть 1. Поcтупление Часть 2. Получение бизнес-визы и первый визит в США Часть 3. Студенческая виза и переезд Часть 4. Что нужно успеть в первые недели PhD Disclaimer: я не уверен, что смогу перечислить тут все подробности получения студенческой…

1.42K views08:27

👍 24

DL in NLP

A Complete List of Important Natural Language Processing Frameworks you should Know (NLP Infographic)

Инфографику по NLP завезли

www.analyticsvidhya.com/blog/2019/08/complete-list-important-frameworks-nlp

Analytics Vidhya

A Complete List of Important Natural Language Processing Frameworks you should Know (NLP Infographic)

This is the era of NLP. From Google AI to Facebook Research, check out the important NLP frameworks since the launch of the Transformers framework.

1.64K views16:22

👍 11

DL in NLP

Оптимизатор, использующий заметно меньше памяти. Звучит интересно, потому что ADAM потребляет памяти в два раза больше, чем сама нейросеть.
Stack more layers теперь будет ещё проще.

twitter.com/JeffDean/status/1167285750766850048

Twitter

Jeff Dean

Reduced memory optimizers! From https://t.co/HHml5ESVjR: For parameters of deep networks ..., we form a cover consisting of slices of codimension one for each tensor. Thus, for an m x n parameter matrix...The memory requirements ... drop from m*n to merely…

3.01K views19:09

👍 7

DL in NLP

Ссылка: https://cutt.ly/qwl2hNM

GitHub

google-research/sm3 at master · google-research/google-research

Google Research. Contribute to google-research/google-research development by creating an account on GitHub.

2.13K views19:09

DL in NLP