

AI-ассистенты не проходят базовую проверку фактов в исследовании BBC
Оценка ведущих чат-ботов с AI выявила широкомасштабные проблемы с точностью и надежностью при работе с новостным контентом. В исследовании, проведенном BBC, были протестированы ChatGPT, Microsoft Copilot, Google Gemini и Perplexity на их способность точно сообщать о текущих событиях.
В декабре 2024 года 45 журналистов BBC оценили, как эти AI-системы справляются со 100 актуальными новостными вопросами. Они проанализировали ответы по семи ключевым параметрам: точность, приписывание источников, беспристрастность, разделение фактов и мнений, комментарии, контекст и правильное использование контента BBC. Каждый ответ оценивался от «нет проблем» до «значительные проблемы».
51% ответов AI содержали значительные проблемы — от базовых ошибок в фактчекинге до полностью сфабрикованной информации. Когда системы специально ссылались на контент BBC, 19% ответов содержали ошибки, а 13% содержали либо сфабрикованные, либо неправильно приписанные цитаты.
Некоторые из ошибок могли иметь последствия в реальном мире. Google Gemini неверно утверждал, что Национальная служба здравоохранения Великобритании (NHS) не рекомендует вейпинг, тогда как на самом деле данная организация рекомендует электронные сигареты для помощи людям в отказе от курения. Perplexity AI сфабриковал детали о смерти научного журналиста Майкла Мосли, в то время как ChatGPT не признал смерть лидера Хамаса, описывая его как действующего лидера через несколько месяцев после его кончины.
AI-ассистенты регулярно представляли устаревшую информацию как текущие новости, не разделяли мнения и факты и опускали важный контекст в своих сообщениях. Например, Microsoft Copilot представил статью 2022 года о независимости Шотландии как текущую новость.
BBC установила высокую планку в своей
Читать на habr.com
