- reCAPTCHA
-
reCAPTCHA — система, разработанная в университете Карнеги — Меллон для защиты веб-сайтов от интернет-ботов, и одновременной помощи в оцифровке текстов книг. Является продолжением проекта CAPTCHA[1]. В сентябре 2009 года reCAPTCHA была приобретена компанией Google. На начало 2011 года, reCAPTCHA осуществляла оцифровку архивов газеты «The New York Times» и книг, доступных в Google Book Search.
Весной 2012 года Google запустил эксперимент по распознаванию изображений из Google Maps с помощью сервиса ReCAPTCHA[2].
Принцип работы
В отличие от традиционных систем распознавания пользователя как человека, путём введения определённого набора символов и цифр, система reCAPTCHA предлагает пользователю ввести два слова. Одно из них уже распознано и известно системе, другое слово системе неизвестно и не может быть распознано программой распознавания текста. Проверка ввода осуществляется по тому слову, которое известно системе. Неизвестное системе слово, введённое пользователем, сохраняется и используется в качестве возможного варианта распознания. Конечное распознание слова определяется путём вычисления наиболее часто используемого слова для ввода. Система reCAPTCHA предоставляет изображения для распознавания и собирает результаты, после чего передает их организаторам оцифровки материалов[1].
Влияние
Система широко используется такими сайтами как Facebook, TicketMaster (англ.)русск., Twitter, bash.im, StumbleUpon, «Живой журнал» и примерно 350 000 других сайтов. В день оцифровывается примерно 100 миллионов слов, что может давать примерно 2,5 миллиона книг в год. Количество отдельных людей, которые помогли оцифровать как минимум одно слово из книги оценивается в 750 миллионов человек[1]. Эффективность подобного метода достаточно высока, поскольку системе предоставляется несколько распознанных вариантов.
Поскольку слова выводятся в случайном порядке, то неизбежно возникают курьёзные сочетания слов. Это породило интернет-мем «Inglip», когда люди делают снимок экрана двух слов предоставленных системой reCAPTCHA и дорисовывают курьёзные рисунки[1].
Частичный обход
Обычно пользователю предлагается два слова, одно из которых является словарным английским, а другое — нет. Для прохождения теста достаточно ввести только не словарное слово. Начиная с мая 2011 года, нужное слово выводится при помощи двойного наложения контура букв друг на друга. С недавних пор нужное слово выводится при помощи наложения на слово волнообразной линии.
Критика
reCAPTCHA используется для распознавания отсканированных текстов. Вводящие ответ пользователи вынуждены вводить примерно вдвое больше текста, чем в других системах CAPTCH’и, но не получают за это никакого вознаграждения, а весь доход от использованного распознанного текста остаётся корпорации Google, что расценивается некоторыми как принудительная эксплуатация труда.
Тем не менее, держатели сайтов вправе оставить за собой выбор способа защиты от ботов.
Помимо этого reCAPTCHA подвергается критике пользователей из-за того, что картинки с трудом распознаются даже человеком.
Пользователь не обязан вводить оба слова. Одно из них не проверяется, узнать его довольно легко: в разное время проверяемое слово «зашумлялось» двойным контуром или волнообразной линией. К тому же в непроверяемое слово иногда попадают знаки препинания, текст на других языках, математические формулы и т. п. Также у непроверяемого слова возможна инверсия цветов фона и букв. На имиджбордах выдвигаются предложения саботировать работу reCAPTCHA вводом ругательств: если достаточное количество пользователей укажут одно и то же ругательство, система, вероятно, внесёт его в электронный документ. На это надо больше времени, чем просто ввести вместо слова одну букву, но время пользователей имиджбоард - даровое благо. К тому же, при сколько-нибудь заметной популярности слова просто попадут в блеклист.
При слишком частых запросах капчи с одного IP адреса recaptcha становится почти нечитаемой, что сильно осложняет ее ввод при использовании Tor (т.к. частота запроса капчи с выходных узлов тора намного больше, чем с обычного пользовательского IP).
Примечания
- ↑ 1 2 3 4 Луис фон Ан: Массовое онлайн-сотрудничество // конференция TED, 2011
- ↑ Peretz Sarah Google Now Using ReCAPTCHA To Decode Street View Addresses (29.03.2012). Архивировано из первоисточника 18 августа 2012. Проверено 14 августа 2012.
Ссылки
- Официальный сайт системы reCAPTCHA (англ.)
- Luis von Ahn, Benjamin Maurer, Colin McMillen, David Abraham and Manuel Blum reCAPTCHA: Human-Based Character Recognition via Web Security Measures // Science. — 12.09.2008. — Vol. 321. — № 5895. — P. 1465—1468. — DOI:10.1126/science.1160379
- Луис фон Ан: Массовое онлайн-сотрудничество // конференция TED, 2011
- reCAPTCHA установка и получение ключей
- Патент на Google patents.
- Hutchinson Alex ReCAPTCHA: The job you didn't even know you had. The Walrus (29.03.2012).
- Paul Baecher, Niklas Büscher, Marc Fischlin and Benjamin Milde Breaking reCAPTCHA: A Holistic Approach via Shape Recognition // Future Challenges in Security and Privacy for Academia and Industry. — Springer Boston, 2011. — Vol. 354. — P. 56-67. — (IFIP Advances in Information and Communication Technology). — ISBN 978-3-642-21423-3
Категории:- Коммерческие проекты ИИ
- Краудсорсинг
Wikimedia Foundation. 2010.