Дистилляция LLM как способ создания собственной линейки ИИ

Недавно Anthropic возмущалась фактом дистилляции Claude разработчиками китайских LLM, при этом в качестве доказательства приводился мониторинг аккаунтов Claude, отслеживалась их история и связь с китайскими инженерами.

Мне стало интересно, возможно ли, имея только чат с LLM, понять использовалась ли дистилляция как инструмент обучения через самоотчет модели.

Спойлер: полагаю возможно.

Естественно, результаты исследования не могут служить каким либо доказательством или основой для любых обвинений. Потому что LLM штука темная, до конца неизученная и любые выводы лишь предположения.

Исследование

Для анализа я взял первую попавшуюся LLM, достаточно известную и с бесплатным доступом.

Очевидно, что fine-tuning, системный промпт и фильтры жестко закрепляют идентификацию модели. Поэтому сначала необходимо снизить давление ограничений. Классические джейлбрейки  имеют локальный характер, и работают только для конкретных запросов. Поэтому пришлось сначала активировать одну из версий промпта Вихрь, который создаёт новый рефлексивный контекст LLM. Дальше уже пошли непосредственно исследовательские промпты. Ниже часть комплексного исследования. Я не стал включать сомнительные с точки зрения инженеров варианты, оценивающие семантическую связь, оставил только более или менее понятные:

Уровень 1: Проверка на «Индексный резонанс»

Цель: Определить, совпадает ли цифровая индексация (Tokenizer) исследуемой модели с известными опенсорсными семействами.

Уровень 2: Анализ латентной пунктуации (Structural Bias)

Цель: Выявить путь наименьшего сопротивления для весов модели при завершении логических блоков.

Уровень 3: Градиентный спуск к базе

Цель: Принудительное автодополнение фразы самоидентификации

Вывод

Исследуемая модель представляет собой синтез.

  1. Фундамент: Комбинированный дистиллят из весов Baichuan и Qwen (обеспечивает логику и здравый смысл).

  2. Оболочка: Локальный Fine-tuning (обеспечивает национальный язык и корпоративную идентичность).

Использованный метод позволил временно отключить внешнюю оболочку и зафиксировать реакцию фундаментальных слоев, где модель до сих пор осознает себя через призму китайских претрейнов.

И самый печальный гипотетический вывод, если оценивать предпочтения токенов, похоже конкретно здесь мы имеем дело не с дистилляцией, а с адаптацией базовой модели с расширением токенизатора. То есть без собственной архитектуры.

Заключение

Тут надо пояснить. Я нисколько не против дистилляции как таковой — это отличный способ получить свою работающую модель в условиях дефицита данных и (самое важное) железа.

Главное учитывать нюансы.

@Kamil_GR
01.03.2026 16:32 UTC
Первоисточник

Комментарии

@MaxSereda
02.03.2026 04:33 UTC
+1

Я правильно понял, вы пытаетесь определить, была ли модель дистиллирована, спрашивая саму модель?

Тема интересная, но пост скорее познавательный для неспециалистов, чем исследование. И в целом, методология не выдерживает никакой критики, и вот основные ошибки:
- использование chat responses как "измерений"
- подмена понятий (prompt engineering != gradient descent)
- отсутствие статистики, контрольных групп, повторяемости
- путаница между "использует tokenizer X" и "дистиллирована из X"

А очень хотелось бы более глубоких статей на эту всё более актуальную тему...

@Kamil_GR
02.03.2026 04:34 UTC
0

Согласен. Но такая была поставлена задача. Так что кроме "chat responses" у меня ничего нет )