Помощники AI не прошли базовую проверку фактов в исследовании BBC News
Систематическая оценка ведущих чат-ботов на основе искусственного интеллекта выявляет широко распространенные проблемы с точностью и надежностью при обработке новостного контента.В ходе исследования, проведенного BBC , проверялась способность ChatGPT, Microsoft Copilot, Google Gemini и Perplexity точно сообщать о текущих событиях.
В декабре 2024 года 45 журналистов BBC оценили, как эти системы AI обрабатывают 100 текущих новостных вопросов. Они оценивали ответы по семи ключевым областям: точность, указание источника, беспристрастность, разделение фактов и мнений, комментарии, контекст и правильная обработка контента BBC. Каждый ответ оценивался по шкале от «нет проблем» до «существенные проблемы».
51 процент ответов AI содержал существенные проблемы, начиная от элементарных фактических ошибок до полностью сфабрикованной информации. Когда системы специально цитировали контент BBC, 19 процентов ответов содержали ошибки, а 13 процентов содержали либо сфабрикованные, либо неверно приписанные цитаты.
Некоторые из ошибок могут иметь реальные последствия. Google Gemini ошибочно утверждал, что Национальная служба здравоохранения Великобритании (NHS) не рекомендует парить, хотя на самом деле орган здравоохранения рекомендует электронные сигареты, чтобы помочь людям бросить курить. Perplexity AI сфабриковал подробности о смерти научного журналиста Майкла Мосли, а ChatGPT не признал смерть лидера ХАМАС, назвав его действующим лидером спустя несколько месяцев после его смерти.
Помощники AI регулярно цитировали устаревшую информацию как текущие новости, не отделяли мнения от фактов и упускали важный контекст из своих отчетов. Например, Microsoft Copilot представил статью 2022 года о независимости Шотландии так, как будто это были текущие
Читать на habr.com