Small Data Science for Russian Adventurers

#конференция
Подача заявок на конференцию в СПб по ИИ 23-26 июня 2020 года
http://agi-conf.org/2020/

👍1

1.24K viewsedited 12:47

Small Data Science for Russian Adventurers

#книга
Мартин О. "Байесовский анализ на Python" (Bayesian Analysis with Python)
Прочитал на каникулах книгу, которая очень понравилась по оглавлению и названию, но был разочарован... написано неплохо, перевод тоже хороший, тема интересная, но вот целевой аудитории для книги нет... если Вы не знаете ничего про байесовский анализ, то из книги не узнаете, если не умеете работать со специализированными пакетами, то ничему не научитесь, если не знаете методов машинного обучения, боюсь, что и не узнаете. Получилась "солянка" (всего понемножку), которая в русском издании, к тому же, немного устарела:(

1.56K viewsedited 14:46

Small Data Science for Russian Adventurers

#курс
Чтобы хорошо изучить какую-нибудь тему, лучше это делать с помощью «узкого курса», который подготовил специалист по этой теме: там глубокое погружение и часто внимание обращают на такие тонкости, которых Вы не узнаете из «универсальных курсов». В интернете полно хороших курсов по отдельным темам, которые «не на слуху». В качестве примера даю ссылку на курс Продвинутая регрессия: обобщенная линейная и логистическая регрессии, подробно рассмотрен метод максимального правдоподобия и экспоненциальное семейство распределений, различные статистические свойства параметров и из оценок. Весь код, к сожалению или счастью, на R и SAS (курс немного древний, но актуальности совсем не потерял)
http://web.as.uky.edu/statistics/users/pbreheny/760/S13/notes.html

1.53K viewsedited 13:01

Small Data Science for Russian Adventurers

#поучительно
Почти детективная и поучительная история... лучшего Российского кэглера Павла Плескова навечно забанили на соревновательной платформе kaggle.com
https://www.kaggle.com/c/petfinder-adoption-prediction/discussion/125436
Все подробности есть по ссылке. Кратко, в соревновании "PetFinder.my Adoption Prediction" команда Павла использовала правильные ответы на контрольной выборке, тщательно замаскировав это в коде. Обман выявился через несколько месяцев, вызвал негативную реакцию в Kaggle-сообществе, привёл к исключению членов команды из рейтинга Kaggle (вроде, не всех). Компания, в которой работал Павел, уволила его:
https://twitter.com/h2oai/status/1215806481339056128
Сам Павел извинился в своём сообщении в Твиттере:
https://twitter.com/ppleskov/status/1215983188876709888
Это не первая подобная скандальная история на Kaggle, почти все были связаны с Российскими участниками (например, ограничение "1 человек может участвовать только в 1 команде" появилось после действий ребят из Кирова).

Kaggle

PetFinder.my Adoption Prediction

How cute is that doggy in the shelter?

3.84K viewsedited 16:46

Small Data Science for Russian Adventurers

#плагиат
Наверное, многие слышали про проект "Диссернет" - по борьбе с различными неэтическими моментами в Российской науке (плагиатом, липовыми защитами и т.п.),
например, есть анти-рейтинг Российских вузов
http://rosvuz.dissernet.org/

1.41K viewsedited 08:23

Small Data Science for Russian Adventurers

#математика
Eсть красивая теорема, которая описывает геометрическое расположение собственных значений матрицы на комплексной плоскости - Gershgorin circle theorem (GCT)
https://en.wikipedia.org/wiki/Gershgorin_circle_theorem
Она доказана советским математиком, но русской страницы на Wiki про неё нет, а узнал я о ней листая теоретические работы по рекуррентным сетям;)

Wikipedia

Gershgorin circle theorem

In mathematics, the Gershgorin circle theorem may be used to bound the spectrum of a square matrix. It was first published by the Soviet mathematician Semyon Aronovich Gershgorin in 1931. Gershgorin's name has been transliterated in several different ways…

1.62K views15:52

Small Data Science for Russian Adventurers

#soft
Небольшой софт от Микрософт для визуализации и анализа данных
https://cloudblogs.microsoft.com/opensource/2019/10/10/microsoft-open-sources-sanddance-visual-data-exploration-tool/

Microsoft Open Source Blog

Microsoft open sources SandDance, a visual data exploration tool - Microsoft Open Source Blog

SandDance, the beloved data visualization tool from Microsoft Research, has been re-released as an open source project on GitHub.

1.49K views16:16

Small Data Science for Russian Adventurers

#интересно
В этой работе изучали среднюю температуру человеческого тела. Если верить всему, что написано и не задумываться о представительности выборок, то в течение жизни человека она падает. У женщин она чуть выше. И самое интересное, за последние годы она снижается, причём линейно, «норма» 36.6 100 лет назад была в районе 36.9!
https://elifesciences.org/articles/49555

eLife

Decreasing human body temperature in the United States since the Industrial Revolution

Since the Industrial Revolution, normal body temperature in both men and women has decreased monotonically by 0.03°C per birth decade.

1.18K views19:49

Small Data Science for Russian Adventurers

#CATBoost
За что я не люблю катбуст - за постоянные сюрпризы и невозможность простого использования в стандартных пайплайнах. Есть же самая популярная ML-библитека scikit-learn и многие другие библиотеки в неё нормально интегрируются (xgboost, lightgbm и т.п.). Вот сейчас, в готовый код вставил
import catboost as cb
cb.CatBoostClassifier(subsample=0.6, iterations=50, learning_rate=0.3, depth=4, silent=True, random_seed=1)
и всё вывалилось с ошибкой "CatBoostError: You can't change params of fitted model." на строке
model.set_params(**{'random_seed': t});
Что, правда? После стольких лет разработки - нельзя динамически менять параметры?!
Поковырялся в исходниках - ошибка появляется после if self.is_fitted() (т.е. обученную модель не трогают).
Любой другой современный бустинг, имеющий в python-имплементации sklearn-совместимую функуцию нормально бы отработал, только надо было бы написать
model.set_params(**{'random_state': t});

1.57K viewsedited 10:00

Small Data Science for Russian Adventurers

#соревнование
Какой-то очередной хакатон по теме цифровизации индустрии туризма с призовым фондом ~ 1млн руб.
https://travelhack.moscow/#

business.russpass.ru

Moscow Travel Hack 2024

1.33K views16:39

Small Data Science for Russian Adventurers

#статья
Самый типичный вопрос при изучении метрических алгоритмов - какая метрика лучше? Хотя разные метрики, в целом, некорректно сравнивать, есть такая обзорная работа. Интересно, что в журнальном варианте она вышла в прошлом году, хотя её первая версия была залита на Arxiv ещё в 2017. Эксперименты в ней можно критиковать, но лучше, чем ничего...
https://arxiv.org/abs/1708.04321

arXiv.org

The K-nearest neighbor (KNN) classifier is one of the simplest and most common classifiers, yet its performance competes with the most complex classifiers in the literature. The core of this...

1.24K views13:16

Small Data Science for Russian Adventurers

#DL
Очень нравятся ресурсы, которые демонстрируют некоторые DL-методы, пусть и в упрощённом стиле. Например, как из этой подборки (очень удобно давать студентам, которые про DL раньше не слышали):
https://pikabu.ru/story/21_sayt_gde_mozhno_protestirovat_rabotu_neyrosetey_6697786

Пикабу

21 сайт, где можно протестировать работу нейросетей

Убийцы свободного времени

2.09K views15:05

Small Data Science for Russian Adventurers

#книга
Почти про каждую тему в ML можно сделать отдельный курс. Это часто имеет смысл, например, если делать идеальную бакалаврскую программу по анализу данных, в ней могли бы быть отдельные курсы по регрессии, кластеризации и т.п. Вот неплохой конспект лекций "A Comprehensive Guide to Machine Learning" - тут много об одном и том же - линейная регрессия во всех проявлениях (вероятностная постановка, добавление весов объектов и т.п.), но этим книжка и хороша - не везде есть подробности:
http://snasiriany.me/files/ml-book.pdf

1.82K viewsedited 20:51

Small Data Science for Russian Adventurers

#юмор
Терминология от Яна Лекуна;)
https://mobile.twitter.com/ylecun/status/1220384666085138432

Twitter

Yann LeCun

@SuryaGanguli @SussilloDavid Yeah, and way say PCA when you really mean "two-layer linear auto-encoder with a bottleneck"

1.3K viewsedited 19:13

Small Data Science for Russian Adventurers

#интересно
Известные популяризаторы решают задачи... а это, действительно, занятно;)
https://youtu.be/6WetHl8VN1I

YouTube

Форт Боярд Математиков: Побединский, Wild Mathing, Савватеев, Трушин, Гарвард Оксфорд, Математик МГУ

Подписка: https://yangx.top/flesspro

Фантастическая пятёрка математиков - Алексей Савватеев, Борис Трушин, Дмитрий Побединский, Владимир Зубков (Гарвард Оксфорд) и Андрей Павликов (Математик МГУ, Хитман) - попала в замок Злого Духа (Wild Mathing). Выход из него…