Ivan Begtin – Telegram

Ivan Begtin

8.05K subscribers

1.96K photos

3 videos

102 files

4.67K links

I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and other gov related and tech stuff.

Founder of Dateno https://dateno.io

Telegram @ibegtin
Facebook - https://facebook.com/ibegtin
Secure contacts [email protected]

About

Blog

Apps

Platform

8.05K subscribers

В рубрике закрытых данных в России, из открытого доступа убрали сведения о расположении кораблей в портах [1] [2], похоже во всех, поскольку мне пока не удалось найти порт в котором бы эта информация раскрывалась на официальном сайте. А также закрыли систему "Судозаходы в РФ" [3]. Ранее сведения из "Табло портов" [4] в этой системе были общедоступны, теперь доступны только для зарегистрированных пользователей. Не могу сказать когда именно эти сведения стали скрывать, но точно в последние 2 года, поскольку ещё в октябре 2021 года они были доступны.

Хотя эти данные и не были открытыми и машиночитаемыми, в машиночитаемую форму они легко превращались.

Ссылки:
[1] https://www.mapm.ru/Port/View_TrafficShip
[2] https://bsamp.ru/port-novorossiysk-vessels.php
[3] https://portcall.marinet.ru/index.php
[4] https://portcalltable.marinet.ru/

#opendata #closeddata #russia #transport #ships #ports

Морской порт Новороссийск - Расстановка судов в порту- Федеральное государственное бюджетное учреждение «Администрация морских…

Морской порт Новороссийск - Расстановка судов в порту - Федеральное государственное бюджетное учреждение «Администрация морских портов Черного моря».

2.3K viewsIvan Begtin, 13:46

С некоторым удивлением ~~и лёгким ужасом~~ я убеждаюсь что в России из НКО с активной позицией в сторону защиты граждан в отношении ИИ в РФ осталась только РПЦ. Не могу даже описать как это контрастирует с развитой частью мира. Как думаете сможет РПЦ представлять интересы общества или, всё таки, это аномалия и должны появится/возродиться правозащитные организации в этой области?

2.3K viewsIvan Begtin, 15:17

Защита прав человека в применении к ИИ в России. Кто будет этим заниматься?

Anonymous Poll

РПЦ, конечно же, кто ещё

Верните правозащитников инагентов, снимите с них этот статус

Главная правозащитная организация в РФ - Генеральнай прокуратура!

Найдутся какие-нибудь карманные болтуны из сами-знаете какой палаты, они то никуда не убежали

Ещё чуть-чуть и Пр-во создаст какое-нибудь новое учреждение под такое дело

Как кто?! Ашманов же!

Бизнес как-нибудь сам саморегулируется, главное не мешайте...

Какие права? Зачем права? У нас власть миролюбивая и человеколюбивая...

Я зашёл сюда, случайно, просто посмотреть ответы

301 voters2.5K viewsIvan Begtin, 15:24

Неожиданная новость, Университет Парижа (Сорбонна) с 2024 года отказывается от подписки на проприетарный библиометрический продукт Web of Science и библиометрических продуктов от компании Clarivate в пользу открытого OpenAlex [1].

Это очень хорошая новость для проекта OpenAlex в котором собрано уже более 247 миллионов научных работ [2], а теперь и подключаются ведущие университеты.

А я не могу не напомнить что это одна из крупнейших открытых баз данных научных исследований, доступная в виде полных дампов.

Ссылки:
[1] https://www.sorbonne-universite.fr/en/news/sorbonne-university-unsubscribes-web-science
[2] https://openalex.org/stats

#openaccess #opendata #biblography

8.8K viewsIvan Begtin, 06:26

Тем временем в Евросоюзе чиновники и законодатели согласовали свежий "Закон о ИИ" [1] который уже скоро примут и туда войдут многие положения по весьма жёсткому регулированию создания, применения и эксплуатации ИИ.

В частности будет запрещена эксплуатация ИИ следующих категорий:
- системы биометрической категоризации, использующие чувствительные характеристики (например, политические, религиозные, философские убеждения, сексуальная ориентация, раса);
- нецелевое извлечение изображений лиц из Интернета или записей с камер видеонаблюдения для создания баз данных для распознавания лиц;
- распознавание эмоций на рабочем месте и в учебных заведениях;
- социальный рейтинг, основанный на социальном поведении или личных характеристиках;
- системы искусственного интеллекта, которые манипулируют поведением людей, чтобы обойти их свободную волю;
- ИИ используемый для эксплуатации уязвимостей людей (из-за их возраста, инвалидности, социального или экономического положения).

За исключением таких задач как:
- целевые поиски жертв (похищение, торговля людьми, сексуальная эксплуатация),
- предотвращение конкретной и существующей террористической угрозы или
- локализация или идентификация лица, подозреваемого в совершении одного из конкретных преступлений

А также будут установлены требования к прозрачности ИИ продуктов и создание "песочниц" по контролем национальных властей для разработки ИИ малым и средним бизнесом без влияния глобальных корпораций.

Штрафы за нарушение могут достигать 7% от глобального оборота компании, так что последствия нарушений будут серьёзными, для многих компаний на кону может стоять принципиальное решение присутствовать или нет на рынке ЕС. Многое будет зависеть от того когда те или иные требования закона будут запланированы к исполнению.

Надо сказать что европейское регулирование резко контрастирует с отсутствием регулирования во многих странах или, к примеру, с российским регулированием в котором нет даже намёка на публичное раскрытие информации за исключением регулирования рекомендательных систем.

Ссылки:
[1] https://www.europarl.europa.eu/news/en/press-room/20231206IPR15699/artificial-intelligence-act-deal-on-comprehensive-rules-for-trustworthy-ai

#ai #eu #legislation #regulation

European Parliament

Artificial Intelligence Act: deal on comprehensive rules for trustworthy AI

MEPs reached a political deal with the Council on a bill to ensure AI in Europe is safe, respects fundamental rights and democracy, while businesses can thrive and expand.

2.7K viewsIvan Begtin, 06:05

В качестве регулярного напоминания, портал открытых данных РФ (data.gov.ru) закрыт уже почти 8 месяцев, вероятность что на его месте создадут что-то другое ненулевая, вероятность что новый портал будет содержать все данные с предыдущего - нулевая.

Мы сделали дамп портала в рамках проекта Национального цифрового архива (ruarxive.org) и, хотя, большая часть данных на портале были скорее бесполезными чем необходимыми, среди опубликованных там датасетов могло быть и что-то нужное.

Полную архивную копию портала можно скачать по ссылке [1], общим объёмом в 14Gb.

Ссылки:
[1] https://cdn.ruarxive.org/public/dataportals/data.gov.ru/2022-02-02/datagovru_20220202.zip

#opendata #digitalpreservation #datacatalogs #russia #data #datasets

3.1K viewsIvan Begtin, 11:07

IBM, Meta и ещё более 50 компаний и исследовательских центров создали AI Alliance [1] как Международное сообщество ведущих разработчиков, исследователей и адептов технологий, сотрудничающих вместе для продвижения открытого, безопасного и ответственного искусственного интеллекта. Туда же входят RedHat, Linux Foundation, Oracle, Intel и ещё много и много кто. Например, там есть Hugging Face, но, например, нет Kaggle, если мы говорим про крупные платформы/сообщества исследователей. Зато присутствуют Национальный научный фонд США (NSF) и NASA, единственные государственные организации на текущий момент.

Пока на сайте самого альянса мало информации [2], но явно будет больше интересного и полезного.

А самое главное что фокус усилий и действий альянса будет вокруг ИИ с открытым кодом.

Ссылки:
[1] https://newsroom.ibm.com/AI-Alliance-Launches-as-an-International-Community-of-Leading-Technology-Developers,-Researchers,-and-Adopters-Collaborating-Together-to-Advance-Open,-Safe,-Responsible-AI
[2] https://thealliance.ai

#opensource #ai

AI Alliance Launches as an International Community of Leading Technology Developers, Researchers, and Adopters Collaborating Together…

The AI Alliance is action oriented & decidedly international, designed to create opportunities everywhere through a diverse range of institutions that can shape the evolution of AI in ways that better reflect the needs & the complexity of our societies.

1.9K viewsIvan Begtin, 07:12

2023 год ещё не закончился, но уже время подводить итоги.

Предлагаю простую эстафету и рассказать про:
- 2 достижения в 2023 году
- 2-3 запланированных достижения/проекта/цели на 2024 год
- и одно пожелание на 2024 год.

Я не могу рассказать о многом чем занимаюсь, но об одном большом-любимом хобби переходящим в деятельность могу.
—
Достижения 2023 года:
- Создание общего индекса данных (https://github.com/commondataio/dataportals-registry, https://registry.commondata.io), около 9912+ порталов данных, репозиториев исследовательских данных, порталов с каталогами данных и т. д. MIT Лицензия
- Почти завершено исследование общих API, стандартов данных и практик, связанных с открытыми данными, включая DCAT, CKAN API, Dataverse API, OAI-PMH и около 20+ других.

Планируется на 2024 год:
- Запуск системы поиска данных на основе Common Data Index. Демо-версия уже завершена: проиндексировано около 6 миллионов наборов данных (начало 2024 г.).
- Обновить инструмент Metacrafter с открытым исходным кодом для автоматического определения семантических типов в индексе поисковой системы и создать облачную версию.

Пожелание на следующий год:
- Проиндексировать около 40-50 миллионов наборов данных в поисковой системе и, конечно, всем побольше мира.
—

Напишите в комментариях тут, или в своих телеграм каналах о своих итогах и планах, насколько работа позволяет об этом написать;)

#opendata #data #newyear #plans

GitHub - commondataio/dataportals-registry: Registry of data portals, catalogs, data repositories including data catalogs dataset…

Registry of data portals, catalogs, data repositories including data catalogs dataset and catalog description standard - commondataio/dataportals-registry

1.7K viewsIvan Begtin, edited 10:34

Forwarded from Ах, этот Минфин (Olya Parkhimovich)

Портал СП РФ "Госрасходы" (spending.gov.ru) снова недоступен. На сайте не указаны сроки проведения технических работ, поэтому остается только надеяться на то, что его работа будет возобновлена.

1.6K viewsIvan Begtin, 13:10

Forwarded from Выше квартилей

Les grands embrasements naissent de petites étincelles

На сайте Сорбонны опубликована новость о том, что ведущий университет Франции прекратил свою подписку на Web of Science, а также перестанет использовать другие библиометрические инструменты Clarivate в 2024 году. На выходных эту новость подхватили многие наши коллеги после заметки Ивана Бегтина.

Такое решение обусловлено тенденцией к переходу от проприетарных продуктов к открытым и бесплатным инструментам. Вместо WoS Сорбонна будет использовать OpenAlex, с которым университет собирается заключить партнерское соглашение. В будущем ожидается, что обе стороны возьмут на себя обязательства по сотрудничеству и улучшению качества данных, относящихся к Сорбонне.

Решение Сорбонны подпадает под общий тренд последних лет, связанный с Open Access. Так, в анонсе Сорбонны упоминается Лейденский CWTS Ranking, который также заявляет о приоритетности открытых данных, стремится к полной прозрачности и воспроизводимости своих рейтингов при помощи CrossRef и OpenAlex. Кроме того, Лейденский Университет анонсирует версию «открытого издания» своего рейтинга на базе OpenAlex в 2024 году.

Про OpenAlex в качестве потенциального конкурента библиометрических баз, доступных по подписке, довольно позитивно отзываются и другие университеты:

• Библиотеки HKU, HKUST, Сингапурского университета менеджмента и Университета Калгари публиковали обзорные статьи про OpenAlex с примерами составления API-запросов;
• О преимуществах использования OpenAlex писал университет Хьюстона;
• Лаборатория Утрехтского университета предлагает использовать данные базы в проекте FAIR data;
• Университет Милана официально ссылается на данные OpenAlex в отчетах о научно-исследовательской работе;
• Политехнический университет Каталонии (BarcelonaTech) использует данные базы в рамках мониторинга открытого доступа в каталонских университетах.

Как видно из приведенных заметок, обращение к открытым данных пока ограничивается лишь рекомендациями и инструкциями. Однако уже сейчас очевидно, что инициативу Сорбонны в перспективе могут разделить и другие ведущие университеты. Ведь большие пожары зарождаются из маленьких искр.

#анонсы #новости #открытыйдоступ #университеты #openalex

1.6K viewsIvan Begtin, 15:00

Незаслуженно упущенный мной документ GENERATIVE ARTIFICIAL INTELLIGENCE. OPPORTUNITIES, RISKS AND POLICY CHALLENGES [1] отчет European Parliamentary Technology Assessment о генеративном ИИ с точки зрения регуляторов в Евросоюзе и немного в Японии в контексте влияния ИИ на демократию. В целом весьма полезный обзорный документ.

И туда же вдогонку публикация про норвежский бюджет 2024 года [2] и упоминания расходов на ИИ в нём.

Ссылки:
[1] https://teknologiradet.no/en/publication/epta-report-2023-generative-artificial-intelligence-opportunities-risks-and-policy-challenges/
[2] https://medium.com/ethical-ai-resources/artificial-intelligence-in-the-norwegian-national-budget-for-2024-4f4d5bdde6fc

#ai #readings #eu #norway

Teknologirådet

EPTA Report 2023: Generative Artificial Intelligence - Opportunities, Risks and Policy Challenges

The 2023 EPTA report on Generative AI was released at the annual EPTA conference in Barcelona and is the result of the collaborative efforts of the European Parliamentary Technology Assessment (EPTA) network.

1.9K viewsIvan Begtin, 15:52

Не все знают что в основе проекта Wikidata лежит расширение для MediaWiki под названием Wikibase [1]. Это продукт с открытым кодом созданный в Wikimedia Deutschland и используемый для баз объектов в стиле Mediawiki, со встроенным редактором свойств, схем, объектов, API и поддержкой связанных данных. У Wikibase существует множество инсталляций база которых собрана на Wikibase.world (тоже инсталляция Wikibase)).

Главное отличие Wikibase от того же Semantic MediaWiki, в том что в Semantic Mediawiki есть попытка приблизить текст к структуре, а в Wikibase это попытка приблизить данные к Wiki.

По природе своей проекты на Wikibase включая Wikidata гораздо ближе к сообществам библиотекарей, архивистов, историков и тд. Очень многие проекты на его основе сфокусированы на библиографии, языках и тд.

Но постепенно, та же Wikidata, наполняется референсными данными с которыми можно работать напрямую используя API и библиотеки вроде WikidataIntegrator [3].

Главные плюсы - системность решения, главные минусы - негибкость в отображении данных. Например, у меня в работе есть множество больших реестров которым нужны интерфейсы редактирования и визуализации, с обновлением схем и тд.

Я о некоторых писал, какие-то менее известны:
- реестр всех государственных доменных имён в РФ (от 10 до 200 тысяч)
- реестр семантических типов данных (до 5000)
- реестр порталов данных (от 10 до 20 тысяч)
- каталогов всех цифровых слепков сайлов из Ruarxive (от 10 тысяч)

Вести их в Wikibase было бы правильно, но жуть как неудобно если это не повседневный инструмент. Причём главным образом из-за отсутствия табличного, массового режима обновления данных. Хотя и интеграция с Wikidata актуальна во проектах.

Ссылки:
[1] https://www.mediawiki.org/wiki/Wikibase/Using_Wikibase
[2] https://wikibase.world/query/#PREFIX%20wdt%3A%20%3Chttps%3A%2F%2Fwikibase.world%2Fprop%2Fdirect%2F%3E%0APREFIX%20wd%3A%20%3Chttps%3A%2F%2Fwikibase.world%2Fentity%2F%3E%0A%0ASELECT%20%3FitemLabel%20%3Furl%20%3Fitem%20WHERE%20%7B%0A%20%20%20%20%3Fitem%20wdt%3AP3%20wd%3AQ10%20.%0A%20%20%20%20%3Fitem%20wdt%3AP1%20%3Furl%20.%0A%20%20%20%20%3Fitem%20wdt%3AP13%20wd%3AQ54%20.%0A%20%20%20%20SERVICE%20wikibase%3Alabel%20%7B%20bd%3AserviceParam%20wikibase%3Alanguage%20%22%5BAUTO_LANGUAGE%5D%2Cen%22.%20%7D%0A%7D
[3] https://github.com/SuLab/WikidataIntegrator

#opensource #wikidata #wiki

Wikibase/Using Wikibase - MediaWiki

1.6K viewsIvan Begtin, 10:48

Почему я задумался о Wikibase и аналогичным проектам, потому что Airtable поменял уже какое-то время назад тарифы и теперь поддерживать там бесплатно большие таблицы невозможно. Какие-то таблицы вроде семантических типов данных и реестра каталогов данных я уже переносил в режим их редактирования в Github'е в виде тысяч YAML файлов. А теперь у меня закончилась квота на базы редактирования доменов, международных договоров и архивов сайтов. В общем что-то с этим надо делать и, либо найти альтернативу Airtable, либо перенести на Github и эти базы.

Главное отличие в том что у этих баз много разных связанных сущностей. В этом смысле гораздо проще вести базу каталогов данных, там основная сущность - это каталог. А даже в одной только базе госсайтов сущности включают: домен, организацию, ASN, регион и несколько десятков атрибутов.

Я всерьёз подумываю о том можно ли перенести такое на Wikibase или найти разумную альтернативу Airtable.

#opendata #datasets #data #government #domains

1.8K viewsIvan Begtin, 12:17

Вышел свежий доклад Open Data Maturity 2023 [1] посвящённый целиком зрелости открытых данных в Европейском союзе, странах EFTA и ряде стран кандидатов. Наилучшие оценки в Франции, Польши и Эстонии, далее Украина, Испания и Кипр.

У доклада весьма продуманная методология учитывающая не только и не столько объёмы опубликованных данных, сколько регуляторный фреймворк, измерение востребованности, наличие продуманной стратегии и контроль качества данных. Лично я не удивлён что лидируют французы потому что у них реально портал открытых данных data.gouv.fr лежит в основе их госполитики управления данными, с внятной дорожной картой и инициативами в открытости науки и доступности геоданных как часть общей стратегии и этого портала.

Отдельно интересно что Великобританию в этих докладах более не рассматривают, даже для сравнения со странами ЕС. В профилях стран вместо UK пустое место, что выглядит немного забавно, словно Великобритания исчезла с карт.

В отчёте большой акцент на качестве данных и нему приложены файлы методологии и подробных ответов в опроснике где многое можно узнать о политике стран по открытости. Я, например, узнал что у Черногории таки есть геопортал с экспортом метаданных по стандарту INSPIRE, хотя он и оказался сейчас недоступен.

Ссылки։
[1] https://data.europa.eu/en/publications/open-data-maturity/2023

#opendata #reports #europe

1.6K viewsIvan Begtin, 06:42

Forwarded from Национальный цифровой архив

В марте в России запланированы выборы Президента РФ после которых, как минимум формально, должно быть отправлено в отставку текущее Правительство и собрано новое. Сейчас нельзя предсказать произойдет ли ротация министров и других должностных лиц или всё останется по прежнему, но мы планируем с января по март запустить архивационную кампанию по сохранению официальных сайтов Правительства и федеральных органов власти. Последний раз такая кампания масштабно проводилась в 2017 году перед сменой Правительства 2018 года.

Если Вы знаете какие-либо значимые сайты/онлайн ресурсы/телеграм каналы/сообщества, например, сайты кандидатов в Пр-ты, или иные агитационные ресурсы - напишите в чате @ruarxivechat, мы добавим их в приоритетный список для первоочередной архивации.

Архивацию мы будем проводить по следующим критериям։
- значимость/приоритетность
- риски исчезновения контента
- наличие технологий сбора цифровых материалов
- сложность барьеров в сборе материалов

К примеру, сайт Правительства РФ (www.government.ru):
- имеет высокий приоритет
- средний риск (ранее контент переносили на сайты archive.government.ru и др.)
- может быть заархивирован стандартными технологиями веб-краулинга (не надо писать парсерсы и специальные инструменты)
- устанавливает высокий барьер, поскольку стоит анти-DDoS система блокирующая доступ после определённого числа запросов в течение часа.

На первой стадии выделим первые несколько сотен сайтов / иных цифровых ресурсов, которые будут заархивированы и размечены по этим критериям.

А также предлагаю небольшой опрос по тому какие цифровые ресурсы приоритетно архивировать в следующем году (у каких из них наибольшие риски что они исчезнут).

#digitalpreservation #russia #elections #archives

1.6K viewsIvan Begtin, 07:34

Forwarded from Национальный цифровой архив

Какие цифровые ресурсы наиболее приоритетны для архивации в 2024 году? (можно несколько ответов). Если нет нужных вариантов напишите в чате @ruarxive свой вариант

Anonymous Poll

Госсайты, госпроекты, государственные информационные системы

Конференции, воркшопы, сайты мероприятий

Сайты, телеграм каналы и сообщества политиков, политических партий

Сайты музеев, галерей, архивов, библиотек

Сайты и телеграм каналы негосударственных (независимых) СМИ и личных медиа

Сайты и телеграм каналы государственных и зависимых от государства СМИ

Всё что касается военного конфликта и его последствий (телеграм каналы, публикации)

Сайты НКО, получателей грантов, получателей крупных госконтрактов

299 voters1.8K viewsIvan Begtin, 07:34