Пользователь AGmind (A.G.)
- DeepSeek 0731 на DGX Spark: разгоняю до 68 tok/s и разбираюсь, почему у автора карточки 57
- Как я ужал русский эмбеддер до 24 млн параметров — и чуть не испортил его одной цифрой
- Мини‑ПК на Strix Halo под параллельной нагрузкой: 236 tok/s на 32 одновременных запросах и три ошибки
- Два AMD Strix Halo в AI‑инфраструктуре: 34 контейнера на одном, ~70 tok/s Qwen3.6 на другом
- DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново
- Как я обучил русский RAG‑сплиттер, который режет документы по индексам, а не по тексту
- DeepSeek‑V4‑Flash на двух DGX Spark: как мы убрали очередь и получили multi‑user
- DGX Spark на 256K контексте: тестирую конфигурации vLLM, реальные замеры и почему NVFP4 в mainline сломан
- Кириллица в LLM: почему русский язык в нейросетях стоит дороже и работает медленнее
- DGX Spark: мониторинг unified memory, когда NVML и dcgm‑exporter молчат
- Как я собрал на DGX Spark приватный AI-сервер, и теперь рассказываю, что туда вошло