Новое слово в сфере голосового ИИ: разработан прототип детектора лжи для колл-центров

image

Голосовые агенты становятся все совершеннее, буквально каждый месяц появляются новые интересные наработки. Одна из них — немецкий проект по созданию детектора лжи для колл-центров. Речь идет о создании системы, которая может с высокой степенью вероятности определить, говорит звонящий в колл-центр абонент правду либо же пытается приврать/приукрасить свои утверждения или скрыть намерения.

Система базируется на специфическом дата-сете, сформированном из аудио-записей нескольких десятков преподавателей и студентов. Добровольцы участвовали в дебатах, обсуждая острые темы вроде смертной казни и платного обучения, а произносимые речи записывались на диктофон. О результатах проекта — под катом.

Модель обучали на архитектуре, которая включала сверточные нейронные сети (CNN) и долгую краткосрочную память (LSTM). Точность модели в итоге составляет 98%.

После изучения результатов проекта модель признали пригодной для анализа широкого спектра процессов обслуживания, с уклоном в коммуникацию с клиентами по телефонной связи. Разработанный алгоритм может применяться в любой ситуации, когда сотруднику колл-центра нужно знать, говорит ли клиент искренне.

Зачем? Подобное может понадобиться, например, при анализе сомнительных страховых случаев или оценки утверждений соискателя при приеме на работу. Если он будет делать ложные заявления, система сможет выявить неправду. В итоге алгоритм сможет не только снизить операционные потери сервисных компаний но и уменьшит количество неправдивых утверждений со стороны абонентов.

Подробнее о дата-сете


В отсутствие подходящего общедоступного дата-сета на немецком языке исследователи из Университета прикладных наук Ной-Ульма (HNU) собрали собственный. Для этого пришлось привлекать добровольцев. Авторы идеи решили их найти при помощи простейшего метода — раздачей информационных материалов. Листовки раздавались и расклеивались в университете и местных учебных заведениях. В итоге было отобрано 40 добровольцев в возрасте от 16 лет. Волонтерам платили подарочными картами Amazon на 10 евро — никакого другого вознаграждения не предусматривалось.

Встречи добровольцев проводились по модели дискуссионного клуба, призванной резко поляризовать мнения и вызвать сильные заявления на спорные темы. Это помогало привести к эмоциональному напряжению участников, которое может возникнуть в проблемных разговорах операторов колл-центров с клиентами по телефону.

Участникам дискуссий можно было три минуты выступать перед другими добровольцами на такие темы:


Обработка данных


В ходе обработки данных предпочтение отдавалось подходу автоматического распознавания речи (ASR), а не подходу НЛП (где речь анализируется на лингвистическом уровне с определением «температуры» дискуссии.

Предварительно обработанные образцы записей были проанализированы сначала при помощи Мел-кепстральных коэффициентов (MFCC). Это весьма надежный, зарекомендовавший себя ранее метод, который весьма популярен среди специалистов по анализу речи. Этот метод был впервые предложен в 1980 году. Он не требует использования значительных вычислительных мощностей и не особо требователен к качеству записей. Это особенно важно, поскольку качество аудиопотока в колл-центрах далеко не всегда можно назвать высоким.

Комбинация этих методов позволила создать весьма надежную модель обработки звука, которая вполне работоспособна без привлечения значительных ресурсов и в условиях не самого высокого качества аудиозаписей.

Последние обрабатывались еще и с использованием алгоритма быстрого преобразования Фурье (БПФ) для получения спектрального профиля каждого «аудиокадра» перед окончательной фиксацией для шкалы Мела.

Обучение, результаты и ограничения


Во время обучения извлеченные векторы признаков передаются на слой сверточной сети с распределением по времени, выравниваются и затем передаются на уровень LSTM.

image

В результате обучения точность системы составила 98,91% с точки зрения распознавания намерений (т.е. когда заявленное голосом действие или намерение может не отражать реального положения вещей).

Конечно, для того, чтобы утверждать, что проект успешен на все 100%, желательно иметь более объемную исходную базу данных, т.е. дата-сет не из 40 аудиозаписей. Кроме того, любой язык специфичен и модель, обученная на немецком языке, может не подходить для работы с пользователями, которые говорят на других языках. Поэтому проект требует доработки, но его результаты и точность модели позволяют говорить о том, что модель вполне надежна.
@neuroonet
29.07.2021 04:39 UTC
Первоисточник

Комментарии

@ss-nopol
29.07.2021 01:11 UTC
+9

Хорошо бы наоборот, мне как клиенту хотелось бы знать, говорит ли сотрудник коллцентра правду.

@Andrey_Epifantsev
29.07.2021 03:52 UTC
0
Сотрудник колл-центра идёт жёстко заданному алгоритму. Он говорит то, что ему велели говорить. Скорей всего он даже не знает, говорит ли он правду или неправду.
29.07.2021 04:04 UTC
0

Ну тут как раз всё просто, если он не знает - то скорее всего он доверяет работодателю и верит что говорит правду. Алгоритм то определяет что говорящий говорит осознанную неправду! Даже если на самом деле эта неправда - правда :)
Всё относительно :)

29.07.2021 07:08 UTC
0
shushu
Ве́ра — признание чего-либо истинным независимо от фактического или логического обоснования...

т.е. вера не относится к категории признаков и параметров, опрелеяющих инстинность
29.07.2021 12:31 UTC
0

Дык, алгоритм то не определяет истину/ложь. Алгоритм орюпределяет аномалии в речи, которые свойственны человеку, который говорит осознанную неправду.

29.07.2021 21:19 UTC
0
НЛО прилетело и опубликовало эту надпись здесь
@
29.07.2021 04:50 UTC
0
НЛО прилетело и опубликовало эту надпись здесь
@GospodinKolhoznik
29.07.2021 06:13 UTC
0

Не правду и не неправду, они говорят пустоту по составленному шаблону, особо не пытаясь вникнуть в суть вопросов.

@shushu
29.07.2021 03:22 UTC
0

А вот мне бы хотелось узнать более технические подробности этого :)
Например как вообще происходит захват звука в риалтайм для скормления потока в AI API?
Ну и я так понимаю что AI API должен поддерживать стриминговые данные?

@barbaris76
29.07.2021 04:17 UTC
0

Ну, то есть, судя по методике сбора датасета, фактически модель определяет не то, что поцыэнт говорит правду или неправду, а то, что он волнуется, слишком сильно эмоционирует и т.п.

@C4ET4uK
29.07.2021 04:38 UTC
0

Мне вот интересно, а насколько это законно, не получат ли множественные иски от 2% ложно-положительных?

@DmitriiR
29.07.2021 04:55 UTC
0

Скорей всего решение ИИ будет поводом для более глубокой проверки.

29.07.2021 05:47 UTC
+2

Нет, оно будет поводом для отказа. Глубокую проверку слишком дорого и неэффективно с точки зрения ведения бизнеса проводить.

29.07.2021 06:42 UTC
0

"при анализе сомнительных страховых случаев "

для проверки...

29.07.2021 08:09 UTC
0
НЛО прилетело и опубликовало эту надпись здесь
02.08.2021 07:32 UTC
0

Не получится вмешаться в голос же на телефоне.
Скорее уж всякие Zadarma (у которых IP-телефония) сделают такую доработку.
А потом сделает ТиньковМобайл, в рамках Олега (в голосовой поток они умеют уже лазить же)

@GospodinKolhoznik
29.07.2021 05:37 UTC
+2

Немецкий проект по созданию детектора лжи для колл-центров в ходе исследования на аудио-записях нескольких десятков преподавателей и студентов доказали эффективность собственного детектора лжи на 98%.

Ну вот совсем незаангажированное исследование. Ни один детектор лжи до сих пор не смог доказать статистическую значимость при проведении объективного эксперимента, а эти ребята утверждают, что их шайтан машинка не такая.

Все существующие детекторы определяют не ложь, а в лучшем случае волнение человека. И этот не исключение.

Я уверен, что их детектор такой же лженаучный, как все прочие, но к моему глубокому сожалению боссы многих компаний по всему миру скажут "А почему бы и нет? Внедряем!" И будут заворачивать людей на основании мало того, что аморальных методов, так ещё и лженаучных.

@abutorin
29.07.2021 05:40 UTC
+2

40 добровольцев по 3 часа? И ИИ начинает отличать правду от неправды в 98% случаев? Тесла с принятием луны за желтый сигнал светофора (https://habr.com/ru/news/t/569702/) на дата-сете не меньше десятков тысяч часов нервно курит в сторонке.

@GreySS
29.07.2021 06:31 UTC
+1
Я так понимаю скоро начнут появляться приложения для смартфонов, для обфускации голоса.
@
29.07.2021 09:08 UTC
0
НЛО прилетело и опубликовало эту надпись здесь
29.07.2021 20:45 UTC
0

Скорее будут просто вставлять невоспринимаемый людьми шум. Как тут.

@
29.07.2021 09:06 UTC
0
НЛО прилетело и опубликовало эту надпись здесь
@OlegIva
08.08.2021 18:37 UTC
0

Так и сейчас немало психов-преступников на свободе, в общем-то.

@Stormwalker
29.07.2021 10:03 UTC
0
Это автоматизация предрассудков. Очень соблазнительная технология, которая, конечно, найдет некоторых лжецов, но мне страшно представить, сколько людей с настоящими проблемами она заклеймит лжецами.
@Tyusha
29.07.2021 10:14 UTC
+1

— Здравствуйте, это робот Олег. Хотите взять кредит?

— Нет. Отстаньте.

— Вы всё врёте: вы хотите взять кредит! Согласно п. 5.6.4 раздел (д) параграф 7 по тембру вашего голоса акцепт договора кредитования от вас получен...

...

— Пожалуйста, после разговора помолчите немного в трубку. По вашему молчанию наш робот Олег определит, на как ещё услуги нашего банка вы даёте автоматическое согласие в будущем.

@cahbe
29.07.2021 11:46 UTC
0

Тех поддержка:

-Я ничего не нажимала оно само...

Там в 102% случаев врёт. Раз они такие молодцы может придумают переводчик с бухгалтерского "У меня тут это, а вчера было то, но в другом месте, и вы исправьте, а то ведь работать не возможно"

@Serg10
29.07.2021 15:43 UTC
+1

Перед выборами бы обещания кандидатов проверять такой штукой.

@Wingtiger
30.07.2021 20:53 UTC
0

а смысл?

@vikarti
02.08.2021 07:40 UTC
0

Не поможет
Исландская правдивость для них — профессиональный навык