ai-assistants
Селф-хост на RTX PRO 6000, продолжение: 2-битный DeepSeek V4 Flash x Ornith1.5-35B, как оно?
В прошлой серии сравнил Qwen3.8-27B на своей карте с DeepSeek V4 Flash по API. Меня спросили: а если DeepSeek поставить на ту же карту, урезав до 2 бит? Ответ: 0.697 против 0.731 у той же модели на полной точности — минус 0.034 балла, реальная цена квантования или шум?
Читать далее →