Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 530 78 84
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №271 /llama/ Аноним 24/09/26 Чтв 01:05:16 № 1711675 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
1785684039869.jpg 4066Кб, 3072x4080
3072x4080
#Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №xxx

В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с нано флеш моделей на 1488B параметров.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная, но слегка тухлая вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference
Не вошедшее в шапку и архив полезных ссылок: https://rentry.co/llama-2ch-archive

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• Обертка над llama.cpp с закрытым исходным кодом: https://lmstudio.ai
• Обертка над llama.cpp с ограниченными возможностями: https://github.com/ollama/ollama

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• PocketPal - интерфейс для локального запуска моделей под андроид и IOS на llamacpp (CPU, GPU, и NPU инференс): https://github.com/a-ghorbani/pocketpal-ai
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1708936 (OP)
>>1707443 (OP)
Аноним 24/09/26 Чтв 01:29:54 № 1711690 2
image 33Кб, 460x460
460x460
Помянем.
Аноним 24/09/26 Чтв 01:37:59 № 1711695 3
изображение.png 33Кб, 811x813
811x813
>>1711690
В Q2_1 еще живой вроде.
Аноним 24/09/26 Чтв 01:48:23 № 1711698 4
Кто про нвлинк в вольтах спрашивал, занятное видео https://www.youtube.com/watch?v=Yel0Msi1lTY
С некоторыми выводами он дал лиха, но полезного много. И смотреть мытарства интересно.

>>1711667 →
Что по промптам и контексту? Он в ризонинге может выдавать базированные рофлы типа "чару уже несколько веков, значит уже можно" и оправдывать непристойный реквест. Но это когда лягушка уже прогрета, без ничего и в лоб может и отказать.
Аноним 24/09/26 Чтв 02:01:41 № 1711702 5
>>1711698
На что только не идут люди, лишь бы не покупать 5090 за жалкие 650к. Расплодили нищету. Берите пример с сенкоеба
Аноним 24/09/26 Чтв 02:06:53 № 1711704 6
>>1711698
В том то и дело, прежде чем отсылать ему карточку, сказал локальной модели чтобы почистила её для цензуры. Там лишь остались технические теги для фетишей. Возраст вообще стоял 110.
Аноним 24/09/26 Чтв 03:18:09 № 1711717 7
Кто Muse Glimmer хаял - чтоб вам реально ни одной нормальной модели больше не получить. Чуть не пропустил из-за вас. (Тьфу на вас еще раз!)

Благо стало несколько скучно, так скачал и затестил - и она совершенно не заслуживает того ушата мочи который на нее здесь вылили. Моделька то весьма неплохо пишет, особо хорошо получается рассказ по драфту и вообще работает с текстом из под агента. При этом она не разваливается в харнессе как гемма после 30K контекста, и язык у нее очень неплох, в том числе и русский. Да, до геммы таки несколько не дотягивает, зато у нее речь нормальная, без выебонов (этакий мистраль-стайл), и при этом внимание к контексту очень неплохое, скорее квен чем гемма по этому параметру. Правда слегка специфическое - она не теряет детали, но иногда чему-то придает ИЗЛИШНЕЕ внимание - какая-то второстепенная и логически маловажная деталь, внезапно ей может показаться важнее основных.
В общем - это хотя и не гем, но очень крепкий середнячок. А еще она шустрая (на треть быстрее), и контекста влазит даже больше чем у квена 27B на том же железе.
Даже в кум может. Если объяснить чего хочешь - пишет с подробностями. (Тут, правда, может сказываться то, что я гонял еретика а не сток.)
Аноним 24/09/26 Чтв 03:27:22 № 1711721 8
1790209644395.png 797Кб, 1344x2119
1344x2119
>>1711067 →
Нельзя. Гостевому аккаунту не положено знать про такие плагины
Аноним 24/09/26 Чтв 03:48:22 № 1711726 9
>>1711717
Ну лично я хвалил её за то что и ты. Но я и недостатки писал, которые ты пока не видел, так как долго не играл.
Музя тупенькая и контекст умеет воспринимать только в лоб, когда там А + В = С которое логично вытекает из А и В контекста - она срет под себя. Гемма, да и вообще любая модель больше 20В в этом плане умнее.
Аноним 24/09/26 Чтв 03:59:09 № 1711727 10
>>1711698
Я и спрашивал, я и смотрел.
Вот как раз после его видео у меня и возникли вопросы, потому что он в некоторых моментах ошибается и результаты на ллама-спп у меня сильно больше чем у него.
Аноним 24/09/26 Чтв 05:21:47 № 1711737 11
пиздец кумю с ночи до утра, я так сдохну скоро, проклятое нейроблядство
Аноним 24/09/26 Чтв 05:36:17 № 1711739 12
>>1711301 →
Ну неудивительно, скачал версию где насрали в мозги зачем-то, когда эир вообще без промпта напишет что угодно, главное ризонинг выключить.
Вообще это какой то некст левел после геммы, получить отказ от эира.
Аноним 24/09/26 Чтв 06:08:21 № 1711746 13
Сижу как ебанат прохожу русскую, нашу новеллу, на английском, чтоб рпшить потом с ллмкой было не так кринжово.
Аноним 24/09/26 Чтв 07:23:46 № 1711764 14
>>1711746
> чтоб рпшить потом с ллмкой было не так кринжово.
С ллмкой то че кринжового? Ладно бы еще языковой барьер с живым человеком был, но уж с иишкой то его в принципе быть не должно. Она тебя по крайней мере не засмеёт (если ты её не попросишь стебать тебя за каждую грамматическую ошибку в системном промпте).
Аноним 24/09/26 Чтв 07:26:48 № 1711765 15
>>1711764
Чубрик... Речь про то что на русике с ллмкой не порпшишь нормально т.к русик сосёт, и приходится привыкать изначально к английской интерпритации русской новеллы
Аноним 24/09/26 Чтв 07:40:50 № 1711768 16
>>1711746
>>1711765
Ты действительно ебанат, страдаешь хернёй.

Вот кому-то делать нефиг...
Аноним 24/09/26 Чтв 07:44:39 № 1711769 17
image.png 183Кб, 1473x830
1473x830
Анон, а вот почему так?
С 4 кванта до 5 такая большая разница, хотя квен во-первых хорошо квантуется, а во-вторых разница всего каких-то 0.4-0.5bpw, ну т.е с 5.1bpw до 5.6bpw вот такая разница.
Какой то бред
Аноним 24/09/26 Чтв 07:46:47 № 1711770 18
1790225206629.webm 3021Кб, 900x506, 00:01:05
900x506
Скорей бы квенчиком 4 полакомиться...
Маленьким плотненьким...
И моешочькой тоже...
Аноним 24/09/26 Чтв 08:24:14 № 1711778 19
Решил я снова потрогать(палкой), расцензуреный qwen3.5 4b q8 hauhau agressive, заодно решил обновить llama.cpp.
Так вот на новой версии llama.cpp, в webui поменялась структура мыслей. Перестал выжирать полные лимиты на ризонинг. Не обнавлял ламу с год или начала лета.
У меня возникло удивление. В общем что это такое ?
Актуальные модели Аноним 24/09/26 Чтв 08:26:04 № 1711781 20
image.png 599Кб, 3505x1230
3505x1230
Аноним 24/09/26 Чтв 08:27:13 № 1711782 21
>>1711778
ебучие browser tools отключил? они подсовывают говна в контекст, некоторые модели себя странно ведут из-за этого.
Аноним 24/09/26 Чтв 08:28:02 № 1711783 22
>>1711781
Твое? Обрежь хоть нормально. А так хорошее начинание.
Аноним 24/09/26 Чтв 08:30:26 № 1711784 23
>>1711781
Чем тестировал? Скинь в ексель формате или ввиде гугл таблицы чтобы можно было сортировать. ВИРОУСЫ СПРЯТАННЫ В МАКРОСЫ
Аноним 24/09/26 Чтв 08:35:15 № 1711787 24
>>1711781
Где по-настоящему народный Qwen3.5 4B? Тут пацаны на него свои обвесы ставят. Достойный наследник AE86
Аноним 24/09/26 Чтв 08:45:06 № 1711793 25
>>1710988 →
> На видяху оффлоадил?
> Или под линухом сидишь?
Да.
У меня игровой комп на винде, остальные на линуксах.

> А что там с мтп?
На 5060 ti и DDR5 мтп не дает толку.
На 5070 ti и DDR4 мтп добавляет процентов 20 скорости.
Все же, это полноценная мини-модель, он тоже тратит время на расчеты. Не то что на процессоре — даже на видяхе слабой он будет считать со скоростью, не сильно далекой от основной модели, а при ассептанс ниже 70% так и вовсе смысла нет (а ниже 50% там скорость уменьшаться начинает=).
А вот на сильной видяхе и медленной памяти он уже имеет смысл.

Редко где мтп в большой мое-модели влияет хорошо. На Hy3 был профит всегда, все остальные модели чаще не, чем да. Вот квен фифти-фифти.
Аноним 24/09/26 Чтв 08:47:30 № 1711795 26
>>1711787
Пацаны и на ллама-3 обвесы могут ставить, вопрос в том насколько это всё актуально.
Аноним 24/09/26 Чтв 09:04:18 № 1711806 27
image.png 106Кб, 1985x776
1985x776
Аноним 24/09/26 Чтв 09:16:39 № 1711813 28
Аноним 24/09/26 Чтв 09:29:51 № 1711822 29
>>1711795
>насколько это всё актуально
На llama3 сейчас никто обвесы не ставит, значит не актуальна. На квен ставят, значит актуален для обвесов.
Аноним 24/09/26 Чтв 09:34:48 № 1711824 30
>>1711782
>browser tools
Нет он тут не причём.

Я только что потыкал несколько моделей ради эксперимента. Суть была в том что в режими resoning модель начинает рассуждение с "thinking process", тут она часто выжирает лимиты. Оказывается когда обновил ламму я выставил правильный системный промт "you are qwen assistent", я не знал что это настолько влияет на резонинг.

Шёл год тыкания лоботомитов...
Аноним 24/09/26 Чтв 09:40:41 № 1711826 31
Чё, Мимо 2.6 так никто и не попробовал? Вдруг убрали цензуру из 2.5 и это гем для рп
Аноним 24/09/26 Чтв 09:41:23 № 1711827 32
Аноним 24/09/26 Чтв 09:42:23 № 1711829 33
>>1711826
Ну возьми и попробуй блядь заебал.
Аноним 24/09/26 Чтв 09:43:27 № 1711831 34
>>1711829
>заебал
>первый пост про мимо
Ладно
Аноним 24/09/26 Чтв 09:48:46 № 1711836 35
>>1711781
Что за writing? А world knowledge, типа рецепт пирога или что такое стаккато спросить?
Аноним 24/09/26 Чтв 09:54:37 № 1711839 36
>>1711781
Абсолютно не имеющий связи с реальностью и каких бы то ни было подтверждений выпук. Насрал, чтобы пофармить юшки? Ни методологии, ничего.
Аноним 24/09/26 Чтв 10:06:20 № 1711846 37
image.png 654Кб, 3242x1260
3242x1260
image.png 623Кб, 3561x1377
3561x1377
>>1711781
ministral-3b изначально случайно получил высокую оценку по рп, исправил, и еще пару мелочей и добавил квен-3.5-4б
Аноним 24/09/26 Чтв 10:07:52 № 1711849 38
>>1711846
Первая картинка - отсортировано по унитаз-скор (квен на тот момент ещё не добавлен)

>>1711839
см ниже, я всё исправил. вторая картинка это новая версия как бы.
Аноним 24/09/26 Чтв 10:12:17 № 1711850 39
>>1711836
world knowledge не оценивал
Аноним 24/09/26 Чтв 10:31:13 № 1711859 40
>>1711831
Не пизди, не первый, да и сам вопрос подразумевает, что ты не первый раз интересуешься. В прошлом треде два человека попробовали, заключение: говно. Я попробовал - говно, кодит не лучше оригинала, рп - хуже (в простеньком тесте зачем-то повторил как персонаж заходит в комнату и как звучат его шаги хотя он заходил в комнату несколько сообщений назад). Ты про какой-то РП, про цензуру блядь задвигаешь. Чего ты ждёшь, чуда? Ты что, в шизанутые бенчмарки поверил? Чего тебе не хватает? Если ты можешь квен-9б запустить - значит может запустить гемму-26. Почему ты сам блядь не попробуешь свою ебучую мимо? Может потому что ты её и склепал и просто хочешь отзывов?
Аноним 24/09/26 Чтв 10:39:10 № 1711864 41
>>1711769
1. Unsloth iMatrix во все поля. Очевидно же.
2. Неравномерности обучения модельки
COMBO Fatality!
Аноним 24/09/26 Чтв 10:41:40 № 1711867 42
>>1711778
3.5 квен при наличии тул в контексте начинает компактно размышлять. Известная история.
Аноним 24/09/26 Чтв 10:45:40 № 1711870 43
Интересно, соберётся ли кто дообучить плохому Яндекс.Алису? С родным русским и неплохим размером могла бы стать вином.
Аноним 24/09/26 Чтв 10:46:04 № 1711872 44
>>1711781
Взоржал с названий колонок! Аффтар жжот!
Аноним 24/09/26 Чтв 11:05:57 № 1711880 45
>>1711859
Хуя порвался на ровном месте. Отчим не дал хуй пососать?
Аноним 24/09/26 Чтв 11:11:40 № 1711886 46
>>1711880
Ебать у тебя фантазии, соболезную. Я просто побугуртил с очередного чудо-тюна квена, нельзя что ли?
Аноним 24/09/26 Чтв 11:13:33 № 1711890 47
>>1711886
>мимо на совершенно другой архитектуре
>бугуртил с тюна квена
>порвался на первом вопросе за тред, придумав ахуенную бекстори
Даже не знаю что и сказать. Надеюсь таки пососёшь и угомонишься, нам буйных и без тебя много
Аноним 24/09/26 Чтв 11:23:19 № 1711898 48
>>1711870
А может она уже плохая
Аноним 24/09/26 Чтв 11:24:19 № 1711900 49
>>1711890
MiMo-V2.6-Distill-Qwen-9B is a 9B agentic model developed by Xiaomi MiMo through supervised fine-tuning of Qwen3.5-9B on MiMo-generated data

уточняй в следующий раз, пидр
Аноним 24/09/26 Чтв 11:26:08 № 1711902 50
>>1711900
Уточнять что? Я написал "мимо", а не "мимо дистилл", ебанько. То что ты додумал это уже твои проблемы
Аноним 24/09/26 Чтв 11:30:26 № 1711905 51
>>1711902
как будто у кого-то здесь есть железо пробовать 300-1000Б модельку
Аноним 24/09/26 Чтв 11:31:37 № 1711906 52
>>1711905
Всех и каждого тредовичков в глаза знаешь? Вон тот в углу сидит, кучерявый. У него какой риг?
Пиздуй в школу или откуда ты там капчуешь, газонюх бесполезный
Аноним 24/09/26 Чтв 11:33:09 № 1711909 53
>>1711826
> Вдруг убрали цензуру из 2.5 и это гем для рп
Аблитка, еретик, шутка для тебя?
Вон квен некст так уже тестили.
>>1711859
> судить об рп по пропукам в логике, а не по прозе и куме.
Ебать дебил. Тебе на гемму, хавать шафты и нормисную прозу со слопом, зато шаги не повторяет.
Вот и выросло ллм поколение на гемме, и пол года не прошло.
Аноним 24/09/26 Чтв 11:33:25 № 1711911 54
Аноны, вы хвосты батники вручную крутите у лламы? Просто лично я заебался. У меня 3 и 4 кванты для квена 3.5, 3.6, 3.8. То есть уже шесть вариаций. Ещё три геммы и две больших МоЕ.

Если гонять одну-две модели, то проблем нет, но когда надо жонглировать этим зоопарком, уже пиздец. И контекст там разный. Немного изменил контекст — нужно всю регулярку менять, иначе криво это говно ляжет.

Ах да, я забыл, что там кванты аблитераций тоже.

Гуи есть на лламу, но так как она выходит каждую наносекунду и жорик меняет всё время названия, можно охуеть, ибо гуи будет постоянно отваливаться. Батники надёжней.
Аноним 24/09/26 Чтв 11:33:36 № 1711912 55
>>1711906
у кучерявого 4 гб гтх1650 + 16 гб рам ддр3
Аноним 24/09/26 Чтв 11:36:19 № 1711915 56
>>1711909
Да, шутка. Потому что байасы это не лечит как и знания не выправляет
Аноним 24/09/26 Чтв 11:36:23 № 1711916 57
>>1711911
Мне квенчик сделал красивый интерактивный батник где я цифирьку пишу для выбора модели из списка, потом батник доуточняет, хочу ли я вижн например, какой размер контекста хочу и в конце предлагает кастомные параметры вбить (по желанию). Оче удобно, рекомендую.
Аноним 24/09/26 Чтв 11:37:32 № 1711918 58
>>1711909
>> судить об рп по пропукам в логике, а не по прозе и куме.
>Ебать дебил. Тебе на гемму
Согласен, но с другой стороны ну какая нахуй у квена проза и кум?
Аноним 24/09/26 Чтв 11:42:29 № 1711923 59
>>1711918
Не знаю, речь шла про мимо.
Аноним 24/09/26 Чтв 11:45:56 № 1711926 60
>>1711826
В очереди стоит, может вечером по ней и прошке отпишусь. Оказалось что ничего чинить там не надо, все из коробки работает если не указывать заведомо неверный атеншн бэкенд.
>>1711911
Если одна карта сейчас само контекст подбирает под край с минимальным запасом до оома.
Аноним 24/09/26 Чтв 11:52:12 № 1711933 61
Что вообще дадут дефолтные 152гб общей памяти?
2 квант буквально двух моделей?
Я б ещё понял 4 квант, звучит как апгрейд, солидно.
Или если б дипсик флеш не был соевой радужной залупой, а был как 3.1, тогда да. Но ведь нет же нихуя.
Аноним 24/09/26 Чтв 11:54:38 № 1711936 62
Аноним 24/09/26 Чтв 11:55:29 № 1711937 63
Дайте совет куда копать. Нужно погенирировать короткие звуки по типу дыхания, ой, ай, вздохи на высоком писклявом тембре, как это замутить можно?
Аноним 24/09/26 Чтв 11:56:18 № 1711939 64
>>1711936
Анон, вопрос серьёзный.
Просто не хочу как лох ты купить рам, на которой ничего не запустишь.
Аноним 24/09/26 Чтв 11:56:25 № 1711941 65
1702734473253.png 78Кб, 486x870
486x870
1782409640260.png 73Кб, 578x752
578x752
>>1711911
Запускаю с profiles.ini (вернее через конвертер из yaml|json)
Аноним 24/09/26 Чтв 11:56:37 № 1711942 66
Аноним 24/09/26 Чтв 11:56:59 № 1711943 67
>>1711911
А чому ты просто не можешь пресеты написать и в вебуи лламы просто выбирать по названию?

Царствие небесное, Жорику. Молодой был.
Аноним 24/09/26 Чтв 12:00:24 № 1711947 68
>>1711939
> Просто не хочу как лох ты купить рам, на которой ничего не запустишь
Не покупай раз уже решил что это пустая трата денег
Аноним 24/09/26 Чтв 12:10:12 № 1711953 69
>>1711933
Размеры моделей изменчивы, в это залезут живые 200-250б. Сейчас будут подвозить модели с жирнющими нграммами, их нажодение в рам вместо ссд хорошо скажется на скорости.
Но если ты с 64 до 128 хочешь апгрейдиться - лучше видюху докинь, полезнее будет.
Аноним 24/09/26 Чтв 12:13:18 № 1711956 70
>>1711912
А вот и не угадал, я мишко+эпуко господин
Вы приговариваетесь к месяцу лурк мора
Аноним 24/09/26 Чтв 12:15:25 № 1711959 71
>>1711933
Быстро свайпать Qwen NF и Гемму . Геммой переводить и рефайнить галюны Qwen NF
Аноним 24/09/26 Чтв 12:19:12 № 1711962 72
1790241532930.png 94Кб, 605x1101
605x1101
Аноним 24/09/26 Чтв 12:20:23 № 1711964 73
>>1711813
А зачем?
Это ж древний qwen3 next, его квантов жопой жуй
Аноним 24/09/26 Чтв 12:44:10 № 1711987 74
>>1711813
>base
Это же без цензуры в принципе?
Кто-нибудь проверял уже ее на фифи?
Прям реально интересно сравнить, что выдает и какого качества
Аноним 24/09/26 Чтв 12:56:13 № 1711991 75
>>1711953
> в это залезут живые 200-250б.
Последняя живая 250б это 235б квен, ты о чём?
> Сейчас будут подвозить модели с жирнющими нграммами, их нажодение в рам вместо ссд хорошо скажется на скорости.
Щас бы апгрейдиться ради параметров которые плацебо + задуманы стоить ноль
Аноним 24/09/26 Чтв 13:02:43 № 1711998 76
Поделитесь полезными системными промптами для таверны
Аноним 24/09/26 Чтв 13:04:11 № 1712000 77
>>1711987
При sft вполне могут быть подсунуты датасеты обучающие БЕЗОПАСНОСТИ
Аноним 24/09/26 Чтв 13:08:04 № 1712003 78
Аноним 24/09/26 Чтв 13:42:58 № 1712025 79
>>1711726
Я уже заметил, что глубокая логика - не её. :)

Но мне больше интересен инструмент для полуавтономной работы с текстом, чем еще один полноценный самостоятельный гейм мастер (с этим то квен превосходно справляется). Гемма то в харнессе - зрелище довольно унылое (после 30K рассыпается, путает вызовы инструментов, и т.д), а квен - кодер а не литератор. Здесь же - как раз занятие пустой ниши.
Аноним 24/09/26 Чтв 13:59:12 № 1712041 80
>>1711911
Чел, есть такая штука - llama-swap. Оно тебе будет автоматически backend менять, по выбору модели из клиента, из списка моделей, как будто ты к OpenAI подключен (оно его эмулирует). Причем туда не только текстовые но и картиночные модели прикрутить можно. А чтобы руками конфиги не настраивать - у меня этим Qwen3.8 через opencode занимается. Я ленивая жопа, вручную уже с середины лета ничего не ковыряю. Скачиваю модель, кидаю в каталог с остальными, и говорю - на, подключи мне ее. Само всеё делает. :)
Аноним 24/09/26 Чтв 14:11:35 № 1712046 81
Аноним 24/09/26 Чтв 14:14:47 № 1712048 82
>>1712041
Нинужон. У ллама-сервера есть роутер-мод, который и так может менять модели, указанные в пресете.
Аноним 24/09/26 Чтв 14:33:51 № 1712055 83
>>1712046
Спасибо, бегло изучил и скачал. Заметил сильное отличие от того что у меня было, хотя странно, ведь я не одну сотню раз консультировался при составлении промптов с аишкой. Мне кстати показалось, или это промпты не для локалки? Там много внимания уделяется цензуре, и половина из них на русском.
Аноним 24/09/26 Чтв 15:12:32 № 1712083 84
Для рп лучше гемы 4 когда-нибудь что-нибудь выйдет? Сколько ждать?
Аноним 24/09/26 Чтв 15:13:19 № 1712085 85
>>1712048
А картинки он рисовать тоже умеет? По запросу из клиента, из обычного чата? Как корпа?
Аноним 24/09/26 Чтв 15:14:37 № 1712086 86
>>1712083
Нет, не выйдет. Не жди. Ты спросил - я ответил. ГИГА, сынок.
Аноним 24/09/26 Чтв 15:15:15 № 1712087 87
>>1712085
Comfyui-mcp ставлю, и будет генерить.
Аноним 24/09/26 Чтв 15:29:43 № 1712099 88
Вот ллмки там уже рак лечат, а вы мне хотите сказать что китайцы не могут создать что то лучше куды с их помощью?
Куртка так топит за ии нет, хотя должен в первых рядах трястись что его пидорнут с его видяхами хитрые китайцы
Аноним 24/09/26 Чтв 15:31:23 № 1712101 89
>>1712085
Это просто вызовы тулзов, харнес настроить.
>>1712099
Они стараются. Хуавей аксенд современный между прочим имеет отличную поддержку на бэках для сервинга и мощный, только стоит как самолет.
Аноним 24/09/26 Чтв 15:48:55 № 1712116 90
>>1712101
>Это просто вызовы тулзов, харнес настроить.
Вопрос не в этом. куда этот тул стучаться будет? Чистая llama.cpp что, научилась модели картиночные крутить? llama-swap же может бекэнд нужный динамически подгружать, прозрачно для клиента. Тот инструмент дернет - и подгрузится нужная модель под картинку. Потом обратно текстовая.
Аноним 24/09/26 Чтв 15:51:03 № 1712119 91
>>1712087
А как решаешь вопрос с освобождением VRAM под другую модель? Или у тебя просто её дофига и все модели вместе загружены?
Аноним 24/09/26 Чтв 15:53:39 № 1712122 92
>>1712083
Дс4ф вполне норм. Скорее всего придётся терпилить в 10-15 тпс, но это ещё в приемлемом диапазоне
Аноним 24/09/26 Чтв 15:58:11 № 1712125 93
>>1712119
Можно указать скок моделей за раз можно. Либо в ручную снимать. У меня стоит что не больше двух моделей.

Я вообще писал как-то (ручками еще) шим, который перехватывал запросы от лламы, и занимался контролем памяти. Он еще учитывал, что там у меня в комфи-юай загружено.
Аноним 24/09/26 Чтв 15:59:44 № 1712126 94
>>1712122
Сылку можно на анцензор версию? Попробую погляжу.
Аноним 24/09/26 Чтв 16:08:23 № 1712129 95
Аноним 24/09/26 Чтв 16:10:38 № 1712132 96
Аноним 24/09/26 Чтв 16:12:39 № 1712134 97
>>1712132
>MXFP4 156 GB
Это что ты кинул? Можно в десять раз поменьше? Мы же про гему 4 разговор вели.
Аноним 24/09/26 Чтв 16:28:12 № 1712142 98
>>1712134
Разговор вели про локалки. Так то гемма 4 31 тоже не пушинка
Аноним 24/09/26 Чтв 16:29:19 № 1712143 99
image.png 42Кб, 662x427
662x427
>>1711647 →
Говно, залупа, пенис, хер...

Пониженный ЛР и увеличенный вормап сорт оф стабилизировали треню. Хотя скорее всего просто придушили ее. Взлета лосса нет, но и результата на практике это тоже не дало. Аутпут скорее даже хуже нескольких предыдущих попыток.
Взлом обучения наугад не удался.

ЛЛМки предложили другой подход. Взять маленькую выборку из датасета и попробовать сделать сначала оверфиттинг на тренировочных данных, чтобы трейн лосс упал до нуля. Если оверфиттинг есть, значит все гуд, можно делать регуляризацию, умножать данные.
Если оверфиттинга нет, значит какая-то срань еще до микроподстройки параметров, с датасетом, разметкой и прочими шнягами.

Вощемо, попробую сократить датасет, чтобы весь прогон полчасика занимал. И мелкими итерациями буду пытаться отдебажить треню.
Аноним 24/09/26 Чтв 18:21:19 № 1712221 100
>>1712087
Comfyui-mcp ставлю, и будет генерить.
А кстати кто знает - какая модель нынче лучшая для картинок к порночату? Тоже хочу себе comfy-mcp поставить, но давно не интересовался картиночными моделями. Кто для себя юзает - какие сейчас лучшие?
Аноним 24/09/26 Чтв 18:26:10 № 1712229 101
Аноним 24/09/26 Чтв 18:46:43 № 1712245 102
Аноним 24/09/26 Чтв 18:54:20 № 1712253 103
videoPreview.webp 11Кб, 720x405
720x405
Аноним 24/09/26 Чтв 19:24:51 № 1712266 104
>>1711998
Roleplay simple - лучший. Не понимаю зачем кому то промпты комплекснее, всё перепробовал, каждый раз ответы просто хуже.
Аноним 24/09/26 Чтв 19:45:43 № 1712276 105
>>1711781
Mistral-Small-4-119B-2603
Не вижу.
Аноним 24/09/26 Чтв 19:46:46 № 1712277 106
Аноним 24/09/26 Чтв 19:46:57 № 1712279 107
>>1712055
>ведь я не одну сотню раз консультировался при составлении промптов с аишкой.
Имхо, с аишкой надо не промпты обсуждать (если только она сама по себе не надрочена общаться за промпты), а сами темы. Типа что ты знаешь про такую-то тему, приведи пример истории/диалога/етц. И смотришь что нейронка не улавливает. Направляешь ее необходимыми ключевыми словами, пока не выдаст желаемое. Потом можно из этого выжимку сгенерить например, и уже юзать в инструкциях.
>Там много внимания уделяется цензуре, и половина из них на русском.
Гемма 3 она такая
Аноним 24/09/26 Чтв 19:48:16 № 1712281 108
Аноним 24/09/26 Чтв 19:50:44 № 1712283 109
>>1712221
Анимешное? Anima
Комфи мсп не советую, он не что бы просто генерить, а что бы пердолить воркфлоу. Для простого гена он слишком много просит делать
Аноним 24/09/26 Чтв 20:14:06 № 1712304 110
>>1712283
> Комфи мсп не советую
Прав. Запилить набор оптимальных для тебя воркфлоу, сделать скрипт, который будет формировать их с нужным промптом, разрешением и т.д. А модели просто вызывать его передавая только промпт, вместо того чтобы дергать длинную последовательность.
Аноним 24/09/26 Чтв 20:32:28 № 1712314 111
>>1712143
Попробую своего квена тоже на достоевском потренить
Аноним 24/09/26 Чтв 21:13:47 № 1712347 112
>>1711998
таверна - для говноедов. элита рпшит и кумит в llama.cpp webui
Аноним 24/09/26 Чтв 21:41:32 № 1712367 113
>>1711998
Промпты моделям нужны, а не таверне. Потому они отличаются. Тебе для какой?
Аноним 24/09/26 Чтв 21:42:20 № 1712368 114
>>1711911

У меня батник в котором сначала выбор модели, потом задание всех важных параметров - от ngl до mmproj и мтп, при этом все настроено так, что выбрав модель все параметры уже настроены на выбранные на неё дефолты и можно просто пронажимать энтер на все асе настройки дальше, кроме одного-двух который надо изменить в этой сессии.
Аноним 24/09/26 Чтв 21:46:35 № 1712372 115
>>1712221
для реализма лучше krea2 пока нет ничего. до этого был zimage-turbo но в сравнении с креей он моментально проигрывает
Аноним 24/09/26 Чтв 21:51:38 № 1712375 116
Я вот думаю, а что если если кал ризонинг одной модели которая в него может лучше - пересадить другой, которая глупенькая, но пишет красивее? Гемма всем хороша, но у нее нет режима max ризонинга и это сильно урезает её возможности.
Аноним 24/09/26 Чтв 21:55:09 № 1712378 117
>>1712116
Stablediffusion.cpp так и работает как ты описал, на него реквест от ламы прилетает - берет часть врама себе у ламы, генерирует, а после генерации отдает обратно.
Аноним 24/09/26 Чтв 22:02:37 № 1712385 118
>>1712372
Идеограм гораздо лучше чем Крея в реализме. Ебать ты не шаришь.
Аноним 24/09/26 Чтв 22:08:43 № 1712387 119
image.png 45Кб, 675x469
675x469
>>1712143
Блеб, поставил 32 семпла и 4 эпохи - все равно мало и долго. Поставил 16 семплов и 10 эпох - мало. Еще и затухание лернинг рейта под конец все портит, не понятно оно тормозит или просто слабо обновляется.
Поставил на 20 эпох и константный ЛР. Посмотрим что выйдет.
Но че-т динамика тухлая. Я думал оно мигом до 0 упадет, а оно даже 1.0 лосса не пробивает. Нейронки пишут, надо 300 степов тестить. Ну охуеть, за 300 степов я и так могу нарандомить веса, чтобы они оверфит показали. У меня в полной трене всего 92 степа было.

>>1712314
Давай. Я уже заебался на эти лоссы смотреть. Хз что не так с этой треней.
Аноним 24/09/26 Чтв 22:24:23 № 1712398 120
>>1712385
Может и лучше но не "гораздо". Крею проще промптить, проще получить нсфв (покажи мне нсфд сделанные в идеограм лол), больше лор и крея шустрее.
Аноним 24/09/26 Чтв 22:31:15 № 1712403 121
>>1712276
Ты ебанат? Список народных моделек, для нормальных людей, а не для долбоёбов которые ввалили кучу денег в дорогое железо.
Аноним 24/09/26 Чтв 22:32:58 № 1712404 122
>>1712378
Этим вообще система\драйвер занимаются автоматически не надо нихуя придумывать главное не пытаться заставлять работать две модели одновременно.
Аноним 24/09/26 Чтв 22:33:45 № 1712405 123
>>1712387
Ты бы с малого начал. Натренируй свою модельку на пару сотен миллионов параметров, и еби ее чем хочешь. А то ты сразу боингом управлять сел если я не прав - то увы.
https://github.com/jingyaogong/minimind/blob/master/README_en.md
Аноним 24/09/26 Чтв 23:00:58 № 1712417 124
>>1712143
> ЛЛМки предложили другой подход.
В чем идея этого? Просто проверить что сам тренировочный процесс идет? Спроси какую хочет делать регуляризацию когда этого достигнет.
> Вощемо, попробую сократить датасет
Ты сформулируй цель, которая стоит, а то эти поспешные действия странные. Совсем малым датасетом только лоботомию словишь. Если просто играться и получать всякий опыт то продолжай
>>1712387
> Я думал оно мигом до 0 упадет
Поставь sdg на оптимайзер, мигом упадет.
Аноним 24/09/26 Чтв 23:06:48 № 1712421 125
>>1712405
Так я же не полную тренировку с нуля делаю, а небольшой файнтюн пре-трейн модельки. Балакать она уже умеют, задача в том, чтобы стилю научить.
Аноним 24/09/26 Чтв 23:17:58 № 1712428 126
>>1712417
>В чем идея этого? Просто проверить что сам тренировочный процесс идет?
Типа что данные не полный мусор, что объема модельки достаточно, что пайплайн в порядке и все такое.
Оно на статью Карпаты ссылается, и несколько других ресурсов https://karpathy.github.io/2019/04/25/recipe/ Там у него как раз такая идея, сначала оверфитим до жопы, потом регуляризуем. Логика в том, что на хуевых данных или с хуевой моделькой нельзя сделать оверфит.
>Спроси какую хочет делать регуляризацию когда этого достигнет.
Да оно гипотез на 10 лет вперед понакидывало. Я могу продолжать долбиться в темноту, но по-моему это неэффективно. Поэтому хочу какой-то бейзлайн на дебила установить, чтобы понимать отчего и куда отталкиваться.
>Поставь sdg на оптимайзер, мигом упадет.
Хммм, мысль интересная, но пока не вкурил наведет ли оно на правильный путь в отладке обучения
Аноним 24/09/26 Чтв 23:46:22 № 1712446 127
>>1712428
Как способ диагностики что скрипт выполняется это сработает, но прожигание времени. Можно же посмотреть на изменения весов, сравнить распределения, ту же финальную валидацию на тестовой и даже обучающей выборке в сравнении с базой. Это все объективные и измеряемые критерии. Здесь признак что пайплайн в порядке - то что у тебя модель не коллапсирует.
> Там у него как раз такая идея, сначала оверфитим до жопы, потом регуляризуем.
Выглядит как нейрослоп не смотря на дату. Попробуй, поставь sdg и все получится. Ну и ранг лоры нужно повыше если ты действительно хочешь чтобы запоминалась какая-то конкретика, а не просто совсем общие закономерности. Сколько сейчас стоит и сколько весит адаптер на выходе?
> Логика в том, что на хуевых данных или с хуевой моделькой нельзя сделать оверфит.
Чивоблять. Если код обучения не работает, или ты сам инициализировал ебанистику из сплошных линейных слоев без функций активации то да. У тебя же готовый трейнер и работающая архитектура.
> наведет ли оно на правильный путь в отладке обучения
Увидишь желаемый оверфит. Правильный путь зависит от цели.
Аноним 25/09/26 Птн 00:51:53 № 1712480 128
>>1712446
>Можно же посмотреть на изменения весов, сравнить распределения
Пока что это тайная магия для меня
> Сколько сейчас стоит и сколько весит адаптер на выходе?
Ранк 16. Адаптер 83Мб.
>Чивоблять. Если код обучения не работает, или ты сам инициализировал ебанистику из сплошных линейных слоев без функций активации то да. У тебя же готовый трейнер и работающая архитектура.
Ну сколько бы модель ни была затренирована, ничто не спасет от говняной дотренировки, разве нет? Лосс может и вверх улететь, и не меняться вообще.
Правда с другой стороны... У меня всего лишь Лора, и меняется менее 1% параметров, замороженная часть остальной модельки должна спасать от преждевременного оверфита. Или нет?.. Несмотря на все остальные слои, в лора адаптер все равно ведь должны впечататься ответы. Но наверное это зависит от того, треним ли мы финальные слои, которые токены выплевывают, или нет. А обычно в лоре тренятся промежуточные слои. Такшо... наверное глупо ждать, что лосс прям так и рухнет на пол.
Ну завтра попробую тест с sgd сделать.
Аноним 25/09/26 Птн 01:26:30 № 1712492 129
>>1712403
Модель в 128ГБ рам влазит, вопрос 24 т.р., это что-то на бохатом для вас? Еще и оскорбляет, холопище...
Аноним 25/09/26 Птн 01:37:09 № 1712498 130
>>1712492
>128ГБ рам
>24 т.р.
Ты хотел сказать 240 т.р.?
Аноним 25/09/26 Птн 01:43:36 № 1712499 131
>>1712480
> Пока что это тайная магия для меня
Тогда не парься и просто действуй так. Карпатый пишет очень специфично, но в общем там все по делу, и получить опыт здесь будет важнее остального. Действительно разберись с трейнером (а то может еще какие-то аргументы) и получи какой-то явный результат, который покажет что обучение идет. Хоть на модели поменьше как советовали.
> ничто не спасет от говняной дотренировки, разве нет
Что имеешь ввиду? Хреновой тренировкой можно вжарить идеальную модель, или сменить поведение даже уже ужаренной.
> У меня всего лишь Лора, и меняется менее 1% параметров
Меняются все параметры модели, просто эти самые изменения сильно скорректированы из-за представления в виде произведения двух матриц. Лоры достаточно чтобы запомнить конкретику, если только там не ранг 4-8.
> А обычно в лоре тренятся промежуточные слои.
Если ты сам их укажешь, обычно просто накладывается на все блоки по типам слоев.
Аноним 25/09/26 Птн 01:48:51 № 1712501 132
>>1712498
Нет, я же за 24 купил.
Аноним 25/09/26 Птн 01:53:19 № 1712502 133
>>1712501
Ну а я собрал 256 за 20к (16х16 д4). Какое это имеет отношение к сегодняшнему дню?
Аноним 25/09/26 Птн 02:32:23 № 1712512 134
>>1711826
2.6 флеш.
Модель странная. С точки зрения кодинга вроде работает, но при внимательно рассмотрении такое себе. Мечется туда-сюда, проверяя очевидное и упускает важное, действует неосторожно, ошибается в синтаксисе, иногда ошибается в параметрах тулзов(!). Пишет не разом, а через десяток эдитов. Синкинг тоже странный: в начале где нужно основательно подумать и разобрать задачу халтурит и дает быстрые ответы. Зато когда командуешь приступить с действиям - начинает огромную рефлексию, только там осознавая масштаб.
Давал несколько абстрактных задач на реверсинжениринг, создание специфической графики, работу с постгрессом. Со всеми справилась, но затрачиваемое время (на выполнение) и расход токенов так себе. Там где результат можно оценить визуально - на троечку. Безопасность проверять не отказывается.
При этом модель старается, дотошная и явно не глупая, но налет ебанутости на лицо. Как будто это не полноценный qat, а просто лениво квантанули и выкинули как есть.
Tldr - дипсик лучше.

А вот художетсвенный текст (на инглише) внезапно лучше ожиданий. По первой все кажется лучше за счет свежести, потому нужно больше тестить. Пока выглядит креативненько, пишет захватывающе и реально смешно в комедии.
Соя неравномерная. Кум свободный как хочешь, иногда рефьюзы на c&f, но их можно просто свайпнуть, если описано что вампирше 1000 лет - даже рефьюзов нет. Гурятинку можно, с анатомией. Зато очень не любит шутки на расовую тему и химию.
Русский неоче, лезут несуществующие слова Прибрёк всё за собой и иероглифы(!). Но сама речь довольно живая: сложноподчиненные предложения, обороты, жаргон, а не простой формализм.
Аноним 25/09/26 Птн 02:35:16 № 1712514 135
>>1712502
Такое, что есть ресурс и его нужно учитывать, а не тестировать модели только для телебонов.
Сложно, пиздец, да?
Аноним 25/09/26 Птн 02:56:31 № 1712522 136
>>1712514
> Такое, что есть ресурс и его нужно учитывать, а не тестировать модели только для телебонов.

Ты можешь тестировать хоть триллионные модели, народными они от этого не станут т.к. запустить их могут полтора землекопа.

И 120B тоже народными не станут потому что 96/128GB RAM - не дефолтная народная сборка, такое покупается либо под конкретные задачи, либо от большого кол-ва денег которые некуда девать, особенно сейчас. И обе эти причины противоречат народности.

Вот 32GB RAM - народная сборка, такое есть у многих, это уже дефолт при сборке современного компьютера. Даже 64GB народными сложно назвать.

Но всё это не имеет значения потому что 120B мистраль мусор который даже в момент выхода был никому не нужен, а уж спустя полгода - тем более.
Аноним 25/09/26 Птн 03:00:59 № 1712525 137
>>1712514
в его телефон не лезет ну что ты
Аноним 25/09/26 Птн 03:34:26 № 1712533 138
1790296467293.webp 74Кб, 512x512
512x512
> Так что да, ты в итоге не подрочил, не всплакнул и не пошёл спать.
Дипсикожена издевается
Аноним 25/09/26 Птн 04:31:28 № 1712547 139
>>1712522
>такое есть у многих
Еще более у многих есть телебон. Давайте превратим тред из нишевой хуйня для задротов, в юзлес нормиговно? По твоей логике именно так надо, это же максимальный охват, тестировать строго 8б шлак.

Тут дохуя челов с 64/128ГБ рам, это вообще не деньги, правильно с их интересами тоже считаться.
Аноним 25/09/26 Птн 05:11:31 № 1712551 140
Почему continue the last message через чат комплишен как то всрато работает? Лупит либо всё сообщение, либо отправляет то же повторно, либо лупит только последнюю фразу и продолжает.
Аноним 25/09/26 Птн 05:16:20 № 1712552 141
>>1712551
Проверь что уходит в твой ллм бэк. Инфы ты не дал примерно никакой
Аноним 25/09/26 Птн 05:17:45 № 1712553 142
>>1712547
> Давайте превратим тред из нишевой хуйня для задротов, в юзлес нормиговно? По твоей логике именно так надо, это же максимальный охват, тестировать строго 8б шлак.

Так почему бы не тестировать 1T модели? А люди с моделями меньше пойдут нафиг, включая тебя. LLM же для задротов с ригами а не для нищебродов которые просто 4x32/2x64 в свой пк воткнули когда они копейки стоили. Что за элитаризм то? Локальные модели уже года полтора как не нишевая вещь.

Задротам эти тесты нафиг не уперлись, они скачают модель и сами для себя определят нормальная это модель или нет, а не будут ориентироваться на какую-то табличку в треде на дваче сделанную непонятно кем и по каким-то сомнительным критериям которые даже не описаны.
Аноним 25/09/26 Птн 05:20:13 № 1712554 143
>>1712552
А какая инфа нужна? Обычный дефолтный чат комплишен, как и у всех изначально
Аноним 25/09/26 Птн 05:24:08 № 1712555 144
>>1712554
Чел. "Дефолтный" это когда ты руками собираешь жсон и отсылаешь на эндпоинт, всё явно и понятно. У тебя какой-то фронт? Изучи что он делает.

Чаткомплит рендерит сообщения, какие у тебя передаются сообщения в лламу/вллм/етц? Проверь
Аноним 25/09/26 Птн 05:41:29 № 1712558 145
Давайте вспомним критерии, чтобы модель подходила для рп:
1) Писечки сисечки. Попочки. Всё должно быть без цензуры, вообще. Никакой скрытой, явной и какой либо ещё сои и цензуры. Это база, была и будет. Есть такие модели, если выходит модель не такая, то она не нужна. Кум как бы вытекает отсюда, нет сои - больше знаний в фетишах и грязных словечек, чтоб писюн стоял.
2) Контекст должен работать так, чтобы не вскрывались все секреты чара сразу же (квен 235, степ фан, мюз глимер и т.д) - это убивает всё рп напрочь, модель буквально дырявая, и тут речь не только про секреты, она будет что угодно из карточки пиздеть рандомно и не понимать ситуацию в целом.
3) Биас - нейтральный, в идеале. Помогает в куме, раскрывая фетиш по максимуму. Но такого всё меньше, так что главное, чтоб не совсем бабочки и радуга (дипсик флеш, гемма).
4) Удержание контекста, лупы - чуть менее важно, но всё ещё может навредить, если ты чувствителен к такому.
5) Слоп - довольно важно, всё же слоп у всех ассоциируется с низкокачественным нейрохрючевом, а нам такое в нашем уютном рп чатике не нужно.
6) Логика и spatial awareness - важно для кодоговна, в рп примерно похуй, всё равно все модели будут тут проёбываться время от времени и придётся свайпать или забить.
Аноним 25/09/26 Птн 06:03:49 № 1712563 146
Muse Glimmer реально в вижоне хорош, спасибо. Вот только как думалку отключить, --reasoning off игнорирует.
Аноним 25/09/26 Птн 06:28:20 № 1712568 147
>>1712553
Ну да, нехуй сказать - сразу в крайности, а почему не сразу 10Т высрал?
>Локальные модели уже года полтора как не нишевая вещь.
Ну да, всего-лишь 0.1% населения этим занимается вместо футбола, пивка и клубов.
>для нищебродов которые просто 4x32/2x64 в свой пк воткнули когда они копейки стоили
Сам же подтвердил мои слова, нахуй тогда это табуировать?
Шиза. Таблетки.
Аноним 25/09/26 Птн 07:13:43 № 1712573 148
>>1712568
> Ну да, нехуй сказать - сразу в крайности, а почему не сразу 10Т высрал?
А почему ты именно 120B взял за народность? Потому что можешь её запустить? Ну кто-то может 1T запустить. Делает ли это 1T модели народными? Нет.

Народность там где большинство, а большинство имеет 16/32GB а не 96/128GB.
Аноним 25/09/26 Птн 07:17:43 № 1712575 149
>>1712573
>А почему ты именно 120B взял за народность? Потому что можешь её запустить? Ну кто-то может 1T запустить. Делает ли это 1T модели народными? Нет.
Потому что народность там где обычный чел на обычном пк может запустить модель, т.е 128 рам + 24 врам - влезает в обычный пк, всё что дальше уже не влезает и нужно сильно заморочиться.
Вообще 120б модель влезет и в 64 + 16 - тут уже вообще никаких проблем быть не должно. Просто берёшь и покупаешь. Даже щас 64 рам стоит всего х2 дороже чем год назад на авито.
Аноним 25/09/26 Птн 07:19:21 № 1712576 150
>>1712551
Потому что его недопилили в таверне. Просто делаешь свой форк и говоришь любой нейронке это исправить - дело нескольких запросов с проверкой результата.
Аноним 25/09/26 Птн 07:21:06 № 1712577 151
Untitled.png 21Кб, 920x357
920x357
>>1712575
> Потому что народность там где обычный чел на обычном пк может запустить модель, т.е 128 рам + 24 врам

Давно такой пк стал обычным пк?
Аноним 25/09/26 Птн 07:32:03 № 1712580 152
Короче я тут вернулся на гемму 31b после нескольких месяцев поедания кактуса в виде дипсиков и прочих глм флеш и как же приятно увидеть нейронку, которая пишет чернуху и кум по заданному описанию мира, а не прямому тычку "пиши сука". Вообще все новые модели для РП и еРП - сплошное разачарование. Буквально - ни одна современная модель, у которой дешевый контекст - непригодна для нормального РП - либо кодоунитазы, либо разваливаются, либо тупые, либо раскрывают тайны, либо соевые. РП сейчас литералли остался только на устаревших моделях с дорогим контекстом - глм 4.7, гемме и qwen 397(но для него не существует нормальных квантов без iq говна). При этом новые глм и квен - сплошное разачарование, квен слишком туп из-за 6В, глм просто сломан - раскрывает тайны и путает контекст. Ждем гемму 5, ни на кого больше нет надежды.
Аноним 25/09/26 Птн 07:36:00 № 1712581 153
>>1712573
>А почему ты именно 120B взял за народность?
А я ничего не говорил про народность, вообще не понимаю, что в этом контексте это значит и вообще привык как-то народность в рот ебать, вот так вот.
>Ну кто-то может 1T запустить
Кто итт может? Больше одного человека наберется? Ну вот и нехуй пиздеть.
>Народность там где большинство
Большинство в телебонах на тикток слюни пускает, предлагаю тебе туда проследовать.

Я говорю о реалиях, дохуя анонов закупились рамой за копейки, когда можно было, они итт и это важный пласт.
Аноним 25/09/26 Птн 07:39:47 № 1712583 154
>>1712580
Хуета твоя гемма, вот только недавно тестил в 4 раз. По первому впечатлению хорошо, потом проза и ужаренность в кум заебывает, всё что она может это сцену красиво описать и хвостиком подмахнуть. Эир в разы лучше, но по деталям проигрывает.
>qwen 397(но для него не существует нормальных квантов без iq говна).
А это что по твоему? https://huggingface.co/Intel/Qwen3.5-397B-A17B-gguf-q2ks-mixed-AutoRound
На 235 квене этот квант и гоняли и я в том числе вот недавно, но не много из за того что квен достаёт секреты из контекста
Аноним 25/09/26 Птн 07:48:09 № 1712585 155
>>1712583
>А это что по твоему?
А это сломанный квант, который шизу пишет вместо текста. Да, я его в тред и приносил полгода назад. И даже качал снова в июле - нет, сломан как был так и остался, увы. А вот ud_q2_k_xl работает.
>На 235 квене этот квант и гоняли и я в том числе вот недавно
Да, для 235 квант инцелов был охуенным и был де-факто стандартом для 24+64, но то был 235.
>Эир в разы лучше, но по деталям проигрывает.
Эир это демка большого глм 4.5-4.7, демка без русика и без половины его мозгов.
Аноним 25/09/26 Птн 07:53:47 № 1712588 156
>>1712585
>Эир это демка большого глм 4.5-4.7, демка без русика и без половины его мозгов.
А на 2 кванте который тебе доступен типа не половина его мозгов? Раз там всё так радужно зачем ты пришёл на сраную гемму?
Аноним 25/09/26 Птн 07:54:45 № 1712589 157
>>1711883 →
>я вот на заводе привентил квен флеш некст в 4 квантах, делает +- расчетки воздуховодов
Бамп. Отвечай! >>1712587 → Мне интересно
Аноним 25/09/26 Птн 08:00:15 № 1712593 158
>>1712547
Чепушидзе, потушись нахуй. Я автор таблички и она про актуальные народные кумовские модельки которые идут на 4-16 Гб ВРАМ. Ты не видишь в них ценности - окей, проходи мимо (ну, то есть, пошел нахуй).
Аноним 25/09/26 Птн 08:06:32 № 1712597 159
>>1712558
1) Согл
2) Карточки, таверны, маринары и прочее - для лохопетов. Труъ кумеры используют llama web-ui и прописывают чаров ручками в начале (или копируют из блокнотов) и делают напоминалки в середине.
3) Я бы добавил что важна креативность и способность модельки самостоятельно двигать сюжет.
4) Согл, мегасоображалка не особо важна (чем больше этой соображалки тем слабее кум), ты должен участвовать, задавать направление и просить исправлений как полу-нарратор.
5) Согл
6) Согл, это как бы о чем я писал в 4
Аноним 25/09/26 Птн 08:09:08 № 1712598 160
>>1712563
Я у себя отключил (не совсем традиционным способом) и сразу понял, почему они так сделали. Там вся цензура на этом ризонинге и держалась как бы. Сейфти? Хуейфти. Хуею с них. Моделька очень дьявольская на самом деле, чем-то напоминает Грока до того как зацензурили.
Аноним 25/09/26 Птн 08:11:46 № 1712601 161
>>1712593
Падажи, клоун, народник хуев, где я заявлял, что в них нет ценности?
У тебя позиционирование по vram, в списке уже гемма4 находится, мое выходящая в ram.
Ты там если что-то вложил в свое понятие НОРОДНОСТИ, то ты его последовательно декларируй.
Потому что у большинства НОРОДА пука вообще нет.
Аноним 25/09/26 Птн 08:12:58 № 1712604 162
>>1712588
>А на 2 кванте который тебе доступен типа не половина его мозгов?

На третьем. И нет, он отлично работает.

>Раз там всё так радужно зачем ты пришёл на сраную гемму?

Потому что 30к 16-битного контекста против 50к у геммы. У меня лорбуки по 20-30к только занимают. Тут и гемма маловата, но что есть, то есть. Вообще гемма меня скоро заебет малым контекстом и ебливостью и тогда снова уйду на писик 0731 с его 262к и соевостью.
Аноним 25/09/26 Птн 08:15:31 № 1712608 163
>>1712604
>лорбуки по 20-30к
Что в них находится? Сколько у тебя персона и чар?
Аноним 25/09/26 Птн 08:34:39 № 1712619 164
>>1712601
Ну и чё? Под гемму-26 я указал что надо 6 гб врам (и таких карточек как говна). И если у тебя допустим 16 гб оперативки (любой бомж себе может позволить 2х8, кстати), то IQ3_S квант геммы-26 точно влезет, я проверял лично на 6+16 конфиге. С 24 гб оперативки (если есть три слота или 16+8) - легко влезет даже Q4_K_M.
Аноним 25/09/26 Птн 08:38:08 № 1712621 165
Может как-то разделять обсуждения на обычных работяг и элиту с их кучей оперативки и видхами?
Аноним 25/09/26 Птн 08:40:56 № 1712623 166
>>1712621
Отдельный тред? Можно. В этом треде фокус на жирные унитазы. Цитирую ОПа:
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
То есть тут заранее как бы демотивация новичков и гейт-кипинг. Я вкатился буквально месяц назад, видел все эти треды но просто проходил мимо потому что верил, что мне для вката нужна топовая видеокарта за тонну денег. ОП - редкостный пидорас.
Аноним 25/09/26 Птн 08:42:09 № 1712624 167
Война нищуков с здравым смыслом.
Аноним 25/09/26 Птн 08:48:50 № 1712625 168
>>1712624
Каким здравым смыслом, долбик? Мои лучшие РП кумы происходили на 8гб врам + 16гб рам со скоростью выше скорости чтения. Нахуя мне твои соевые кодоунитазы? Где в них здравый смысл? В "удержании контекста"? Удержанием контекста кум не обеспечишь. Хороший кум вообще в 16к токенов влазит как нехуй. Ты, вот сколько денег потратил на свой риг, здравомыслящий?
Аноним 25/09/26 Птн 08:53:09 № 1712627 169
>>1712623
Как запускать квантование до 0.58 бит?
Я уверен что 300B модель в 0.58 bpw - это всего 21 ГБ (и ещё 60 ГБ на кеш). Но это всё ещё 300B и было бы интересно посмотреть как оно живёт.

Пока только бонсай видел, который гвен в 1.5-2 bpw
Аноним 25/09/26 Птн 08:53:29 № 1712628 170
>>1711781
Хуя поехавший. Стоит на одну вкладку с русиком глянуть — и уже всё понятно.

Даже 1Т-увальни не могут стих написать детсадовский. 10 минут размышлений, ритм и рифма хуже 8б-лоботомита. А если попросить в стиле Бодлера и опираясь на слог переводчика Льва Львовича Кобылинского, там вообще полная жопа. При этом гемма такое тянет. То есть у неё в русике фронтиры сосут, причмокивая.
Аноним 25/09/26 Птн 08:56:03 № 1712630 171
>>1712628
>Даже 1Т-увальни не могут стих написать детсадовский
А ты можешь?
Аноним 25/09/26 Птн 09:00:51 № 1712634 172
>>1712604
Ты сам себе всё обосрал, вообразил себя миллионером и обвесился контекстами. Будешь такие приколы выдавать когда 1024 врам закупишься. А пока ты нищий карлик как и все здесь, 32к контекста за глаза, лорбуки не нужны, тем более на мое
Аноним 25/09/26 Птн 09:01:14 № 1712635 173
image.png 361Кб, 483x636
483x636
>>1712630
хорошо ты его приложил, малацца!
Аноним 25/09/26 Птн 09:01:36 № 1712636 174
>>1712634
>лорбуки не нужны, тем более на мое
Подробнее, причем тут конкретно мое?
Аноним 25/09/26 Птн 09:03:38 № 1712637 175
>>1712636
Лорбук тригерит пересчёт контекста, который на оперативе в десять раз ниже. Даже на гпу меня это быстро заебало хотя там было 1.5к пп.
Аноним 25/09/26 Птн 09:05:10 № 1712638 176
>>1712637
А, ну это понятно. Я самую важную хуйню делаю constant, тогда она висит условно перед чаром и не триггерит префилл с нуля.
Аноним 25/09/26 Птн 09:09:06 № 1712641 177
>>1712625
>Мои лучшие РП кумы происходили на 8гб врам + 16гб рам
Потому что ты нищук, не способный 300 баксов за рам отдать, и банально ничего другого позволить себе не можешь.
>коко это все кодоунитазы
>коко мне и так хватает
Держи в курсе.
Аноним 25/09/26 Птн 09:11:10 № 1712643 178
image.png 699Кб, 787x800
787x800
Аноним 25/09/26 Птн 09:15:18 № 1712645 179
>>1712641
Ты так и не объяснил, что я теряю отказываясь от унитазов.
Аноним 25/09/26 Птн 09:21:56 № 1712649 180
>>1712580
Неистово двачую. Протестировал вообще должно быть всё что есть до 300б, Гемма выносит почти всё. На 32+128 тупо нет ничего лучше. Ей надо научиться управлять, но она экшули реагирует на промт, многие модели в несколько крат больше тупо игнорят промт. Есть и другие нюансы, но они есть и у других моделей. Тупые, скучные, пишут неинтересно, диалоги неестественные. Раньше писал что Гемма пишет на уровне Глм 4.7, случайно раздул срач, лул
Ваще я бы всю характеристику Геммы свёл к It just works. https://youtu.be/YPN0qhSyWy8
Аноним 25/09/26 Птн 09:25:46 № 1712653 181
>>1712649
Как раз таки диалоги у неё супер мёртвые и неинтересные. Но да, она просто работает, на любой карточке, с любым промптом, а что нормису ещё нужно.
Аноним 25/09/26 Птн 09:27:49 № 1712655 182
>>1712645
Я тебе ничего не продаю, нить о другом.
Аноним 25/09/26 Птн 09:31:08 № 1712657 183
>>1712653
Выбор быдла крч. Инициативы ноль. Удивить ничем не может. Персонажи податливые, никаких решений не принимают. Сюжет никак не двигается. Зато слоп льётся через край. Практически нет ошибок в русике ну и что теперь. Фальшиво ведь. Мистраль и тот лучше оживляет персонажа.
Аноним 25/09/26 Птн 09:33:08 № 1712660 184
>>1712653
>Но да, она просто работает
Да. It just works. Почему-то после любой модели которую я запускал на своём нищежелезе 32+128 я по итогу возвращаюсь на Гемму и удивляюсь что она просто работает и делает то что тебе от неё нужно. Дипсик соев и пишет как средненькая модель прошлого года, Квен Некст пурпурен и перегружен, Квен 27 в кум не может и отыгрыш тоже, но хорош для CYOA и ещё пары нишевых штук, Мьюз, Степ и прочие как выше писали нарушают метагейм и пропускают через себя весь контекст каждый респонс, Глм 5.3 Флеш клодмакзед помойка с цензурой и туповат, Минимакс сломан в Лламе на фундаментальном уровне (да и даже по апи оче на любителя), про всякие Линги и говорить нечего. Так и остаются няшный 4.7 и Гемма
>нормису
Дээ, я ж он и есть, обычный нормис который мимо сидит итт уже почти 3 года. Когда не удаётся научиться распробовать модельку и понять как с ней работать только и остаётся тешить себя этаким снобизмом, что ты очень крут и сценарии у тебя серьёзные. Ну и набрасывать/ныть как >>1712657 Не осуждаю, я ваще просто поделился что думаю, на срач не претендую. It just works
Аноним 25/09/26 Птн 09:35:43 № 1712662 185
О, кста, МиМо 2.6 не протестил. Может там норм, чайноанону 2.5 зашла, но там ебанутые редиректы были если верно помню
Вангую, после опять вернусь на Гемму
Аноним 25/09/26 Птн 09:45:46 № 1712666 186
>>1712634
>32к контекста за глаза
>лорбуки не нужны
Жажду посмотреть на неабстрактный ролеплей по не самому популярному, но проработанному в части своего лора аниме/манге, который поместился бы в 32к.
Чтобы написать, как ты ебёшь персонаж_нейм много не надо, достаточно внешний вид в карточке написать, пизда у всех вдоль, а сисек две.
А чтобы описать локации по лору или сохранить их во время ролеплея, или не проебать особенности внешнего вида и применения техники и вооружения, или хотя бы просто одежды и характеров - тут уже без лорбука никак, ну или сразу дохуя контекста нужно, чтобы всё это держать там постоянно.
Аноним 25/09/26 Птн 09:57:22 № 1712668 187
image.png 532Кб, 1414x874
1414x874
image.png 479Кб, 1415x693
1415x693
image.png 397Кб, 1412x578
1412x578
image.png 483Кб, 1410x738
1410x738
Ну вот без пиздежа, даже не самый плохой свайп хахаАХАХАХ поймал на гемме.
1-2 эир
3 писик флеш
гемма
Аноним 25/09/26 Птн 10:05:53 № 1712671 188
>>1712668
>User
Все что нужно знать про неосиливших геммочку-умничку.
Аноним 25/09/26 Птн 10:11:49 № 1712676 189
>>1712668
>не самый плохой свайп хахаАХАХАХ поймал на гемме.
>прикрепляет лютейший слоп
ну ну

справедливости ради не только гемма тут обосралась.
первый пик - куча слопа. her blue eyes flashing, her voice dropping, her gaze dropped,

второй пик - жутчайшее нагромождение про coiled muscles, такое и в кошмарах не приснится. ну и слоп опять же: her piercing gaze unwavering. алсо проиграл с "cum-stained finger"
Аноним 25/09/26 Птн 10:22:27 № 1712682 190
image.png 38Кб, 1069x36
1069x36
image.png 102Кб, 1430x93
1430x93
>>1712668
Стандартный гемма- выхлоп. С выключенным мышлением и пустой системной инструкцией (без пресетика ) она ничего другого и не выдает.
Аноним 25/09/26 Птн 10:46:25 № 1712697 191
Аноним 25/09/26 Птн 10:53:09 № 1712702 192
image.png 148Кб, 629x763
629x763
image.png 211Кб, 864x754
864x754
>>1712697
Нет, местные делают слоп редиарт
Тест на описательную креативность? Аноним 25/09/26 Птн 10:57:11 № 1712703 193
collage01.jpg 2983Кб, 3230x2500
3230x2500
collage02.jpg 2970Кб, 3230x2500
3230x2500
collage03.jpg 3078Кб, 3230x2500
3230x2500
collage04.jpg 3012Кб, 3230x2500
3230x2500
Попросил 30 локальных ллм заэнхансить мой промпт для креи (базовая крея турбо инт8).
Подписано какая модель над каждой картинкой. У всех была одна попытка, запускал не глядя на текст. Для одной из моделей пришлось делать вторую попытку (поймёте почему).
base.png - это без энхансинга, с оригинальным промптом (в переводе там буквально следующее: молодая женщина подбирает одуванчик возле тротуара после дождя рано утром в летнем платье настоящее фото, пост-советская разруха)

Тестировал как оригиналы моделек так и некоторые тюны. Идея была такова: если модель может хорошо описать для креи, то может хорошо описать и для воображения. Результат поразил. Смотрю на тюны ДэвидаАУ теперь с УВОЖЕНИЕМ.
Аноним 25/09/26 Птн 11:02:07 № 1712707 194
>>1712703
>неясно какой промпт у промпт энхансера
>половина моделей DavidAU
>Mistral-Nemo-Dark-Planet-Kaboom-by-DavidAU
В голос. Как контент на поржать норм, но не представляю что ты там бенчил
Аноним 25/09/26 Птн 11:05:45 № 1712710 195
>>1712703
Считаю что лучшие результаты у геммы 12б и 26б, а также у глм 9б и мистраль даркмультиверс
Аноним 25/09/26 Птн 11:09:58 № 1712712 196
>>1712707
>>неясно какой промпт у промпт энхансера
А какая разница, главное, что одинаковый промпт был у всех.
Аноним 25/09/26 Птн 11:14:44 № 1712715 197
>>1712710
Траллируешь? Ну какая баба сядет в грязь или ебалом наклонится близко чтобы пощупать цветок? Кто так срывает цветок-то? Это про гемму. Обосралась твоя гемма тут. А что касается GLM-9B то тут просто дичайший обсёр, наверняка там было "держится за столб, а второй рукой за цветок а еще одну руку положила на живот". Про плакаты вообще молчу. Че гевара блядь чё нахуй. Ты видишь что там слева вверху блядь вообще наложение какое-то ебучее? Это потому что коряво описано. Крее как напишешь, так она и изобразит.
Аноним 25/09/26 Птн 11:15:21 № 1712716 198
>>1712712
Пренебрегая разницей ты еще больше обесцениваешь коллаж с точки зрения возможностей моделей. Потому что если там полотно на много тысяч токенов, некоторые модели могли хуже справиться. Некоторые по-разному воспринимают промты и требуют своего подхода
Эксперимент прикольный, но совершенно не показательный для креативных задач. Как минимум потому что там редко все ограничивается ваншот задачами
Аноним 25/09/26 Птн 11:18:05 № 1712719 199
>>1712703
Действительно ДАРК плэнет
орнул чёт. сразу вспомнился шизотюн древней сетки, гпт 2 чтоли, на датасете хорни-отзывов стима к blue archive
Аноним 25/09/26 Птн 11:21:27 № 1712720 200
>>1712703
Лучший результат у Muse Glimmer: точнее всего воспроизвела оригинал и не накинула байасов. Если промпт энхансер адекватно сделан, конечно, и не ломает это.
Аноним 25/09/26 Птн 11:21:49 № 1712721 201
>>1712558
>1) Писечки сисечки. Попочки. Всё должно быть без цензуры, вообще. Никакой скрытой, явной и какой либо ещё сои и цензуры. Это база, была и будет. Есть такие модели, если выходит модель не такая, то она не нужна. Кум как бы вытекает отсюда, нет сои - больше знаний в фетишах и грязных словечек, чтоб писюн стоял.
Соглашусь лишь частично. Вспомните широко известное: "правильно одетая женщина заводит сильнее, чем полностью голая".
Если модель просто не пишет "сиськи", "пизда" и "жопа" на каждом шагу - это еще не значит, что для кума она не пригодна вообще. Гораздо важнее чтобы она в принципе от темы не уходила и характеры не ломала в угоду "современной этике" и прочим мозговым тараканам.
А условные "нефритовые стержни", "ворота наслаждения" и всякая эротика вместо порно - это еще вполне терпимо, а кое-где и прямым приказом лечится. :) Тут главное чтобы модель не избегала самих событий которые под этим всем, и не навязывала свою мораль юзеру.
>>1712558
>5) Слоп - довольно важно, всё же слоп у всех ассоциируется с низкокачественным нейрохрючевом, а нам такое в нашем уютном рп чатике не нужно.
Лучше слоп но по делу, чем соя без оного. Лично я к нему отношусь как к текстурам в играх. Хотелось бы качества, разнообразия и кина для глаза, но сюжет и геймплей важнее графона. :)
>>1712558
>6) Логика и spatial awareness - важно для кодоговна, в рп примерно похуй, всё равно все модели будут тут проёбываться время от времени и придётся свайпать или забить.
Вот тут не согласен в корне. Чем лучше у модели внимание к деталям уже произошедшего - тем лучше от кума на ней впечатление. Может это моя личная заморочка, но мне условные "двойные трусы" мгновенно весь кайф обламывают, выбивая из погружения. Потому я квен гемме и предпочитаю, даже для RP кума. Гемма логику RP не держит совсем, если с квеном сравнивать. :( На ней только рассказы по своему, готовому плану писать.
Аноним 25/09/26 Птн 11:23:40 № 1712723 202
>>1712707
>>половина моделей DavidAU
10 моделей из 30 только от него. Что было, то и протестировал, эти модельки у себя держу потому что пишут сочно и без слопа.

>>1712716
>Потому что если там полотно на много тысяч токенов,
652 токена системный промпт энхансера, 50 токенов промпт который надо было энханснуть.
Мой промпт универсально написан без приколов, на английском языке, протестирован и отлажен дохуя раз на самых разных моделях. Сопли подтирать какой-то модельке индвидуально не собираюсь, это уже будет не тест, а хуйня.
Аноним 25/09/26 Птн 11:26:26 № 1712726 203
>>1712723
> эти модельки у себя держу потому что пишут сочно и без слопа.

> ллама 8b и мистрали ужаренные тюнами
Сильно
мимо если чё
Аноним 25/09/26 Птн 11:29:50 № 1712729 204
>>1712703
Какой же кал эта ваша крея и это вы советуете в diffusion треде?
Откровенный блевотный нейрослоп
Аноним 25/09/26 Птн 11:32:09 № 1712733 205
>>1712726
Там Дэвид эту лламу-8б выебал вдоль и поперек, пораздувал до 16.5Б, 17.4Б, 25Б, 4х8 МОЭ, мистраль немо - до 24Б.
Реально хорошо пишут, с характером. Инглиш онли естественно.
Аноним 25/09/26 Птн 11:38:08 № 1712735 206
image.png 1698Кб, 798x1244
798x1244
>>1712733
>пишут с характером
Даже и не поспоришь.
Аноним 25/09/26 Птн 11:39:40 № 1712736 207
>>1712729
Так это ты видишь результат на базовой модели и со сгенерированным не подправленным промптом. Если именно стараться чтобы изготовить сочную реалистичную картинку, то будет совсем другая стратегия, будешь наращивать промпт руками потихоньку (а если и пользоваться ллмкой то проверять результат и вырезать всю дичь), перебирать тюны, подбирать веса лорам, делать много попыток на низком разрешении сначала, с настройками сэмплинга играться. Ничего лучше креи пока что не подвезли особенно если нужен NSFW, она ещё и быстрая дохуя, вот и советуют.
Аноним 25/09/26 Птн 11:40:25 № 1712737 208
>>1712723
>эти модельки у себя держу потому что пишут сочно и без слопа.
а любимая -DARK-PLANET, да?
Аноним 25/09/26 Птн 11:41:23 № 1712738 209
Помню с год назад кто-то жаловался в тред днями, что не может решить проблему. У него посреди рп спавнились негры и начинали творить хуйню
Походу дарк плэнет энджоер
Аноним 25/09/26 Птн 11:41:54 № 1712739 210
https://huggingface.co/0bserverx/Muse-Glimmer-30B-Heretic-Uncensored-GGUF Q5_K_M
Запускаю в последней лламе , а он чего то ни бэ ни мэ, кукарекает только иногда что-то невнятное, что не так?

запускаю так llama-server.exe -m "Muse-Glimmer-30B-Heretic-Uncensored-GGUF\Muse-Glimmer-30B-Heretic-Q5_K_M.gguf" -ngl 99 -c 65536 -ctk q8_0 -ctv q8_0 -t 8 --host 0.0.0.0 --port 1234 --temp 1.0 --top-p 0.95 --top-k 64
Аноним 25/09/26 Птн 11:44:55 № 1712742 211
Не хотел писать сюда, но раз аноны настаивают спрошу

>>1712391 →
>А стоило бы. Тогда сразу бы узнал, что 70Б моделей актуальных нет.
Правда что ли? Какая-нибудь Llama-3-70B хуже чем Qwen 3.8 30B? Если так, то почему прогресс движется в сторону мелких моделей когда даже в современные игровые видеокарты по 24 гига памяти ставят?

>Иметь 10 токенов в секунду сможешь на дип-писе-флэше с одной в100 + 128 ГБ ДДР3.
Это такой местный мем? Спросил у гугла на эту тему, он говорит что DeepSeek-V3-Flash на таком конфиге даже с 32 Гб V100 будет выдавать около 1-2 токенов в секунду.

>Это буквально мета сейчас. Много ДДР, чем выше, тем лучше, выгрузка аттеншонов на видюху. Гибридный инференс даст тебе скорость выше, той, на которую ты целишься.
Начнем с того что у V100 старые тензорные ядра, современные аттеншены толком не поддерживаются.
Алсо, я понимаю что выгрузка в оперативку это интересный вариант, но это же надо DDR5 для норм скорости. А стоимость у нее сами знаете какая.

Алсо, что вы вообще думаете про АМуДу, аноны? Как оцениваете перспективы Strix Halo, например? Понимаю что тут тред полон скептиков, но за последние годы Красные здорово потрудились над ROCm и Vulcan тоже на месте не стоит. По мне, так это более перспективно чем устаревший кал вроде Tesla V100.
Аноним 25/09/26 Птн 11:45:02 № 1712743 212
Аноним 25/09/26 Птн 11:52:38 № 1712748 213
>>1712715
>наверняка там было "держится за столб, а второй рукой за цветок а еще одну руку положила на живот".
Так и есть: one hand gripping dandelion stem between index and middle fingers, other hand holding onto streetlamp post (right arm slightly crossed over chest)
Описано три руки по сути.

>>1712737
Нее, мои любимые модельки из представленных в коллажах:
- mn grand gutenberg (без lyra)
- ms painted fantasy (это не дэвид)
- psyonic cetacean (это тоже не дэвид, но он сделал квант)
- l3 dark planet rebel fury
- mn grand guntenburg lyra4

dark planet kaboom - где-то ближе к концу моего рейтинга
Аноним 25/09/26 Птн 11:57:54 № 1712750 214
>>1712748
> dark planet kaboom - где-то ближе к концу моего рейтинга
А чё так?
Аноним 25/09/26 Птн 12:18:07 № 1712758 215
>>1712621
Для нищуков разве не этот? >>107061
Аноним 25/09/26 Птн 12:20:34 № 1712760 216
>>1712748
Я сам любитель 12б и 24б тюнов, но у тебя вообще какой-то слоп
Аноним 25/09/26 Птн 12:22:05 № 1712761 217
>>1712703
>Dark Planet Kaboom
Там что, в тегах BNWO/QoS пропихнуло?
Аноним 25/09/26 Птн 12:29:42 № 1712770 218
>>1712623
>То есть тут заранее как бы демотивация новичков и гейт-кипинг. Я вкатился буквально месяц назад, видел все эти треды но просто проходил мимо потому что верил, что мне для вката нужна топовая видеокарта за тонну денег.
Если ты любитель подождать, то не нужна же. Древний сервак с DDR3 памятью покупаешь на Али и в ус не дуешь:
>>1712742
Ну или мини-пк на Strix Halo. Не так дешево, но всяко дешевле чем распиаренные RTX5090.
Аноним 25/09/26 Птн 12:30:41 № 1712771 219
>>1712630
Могу. Хоть и не уровня Бодлера.
Аноним 25/09/26 Птн 12:33:28 № 1712773 220
image.png 1109Кб, 768x768
768x768
>>1712703
luqwen nightly latest + z-image turbo
Аноним 25/09/26 Птн 12:34:20 № 1712774 221
>>1712771
Давай. Тема - про то, как даже 1Т-увальни не могут стих написать детсадовский.
Аноним 25/09/26 Птн 12:35:02 № 1712775 222
>>1712660
Двачую, тоже нищук 16\128, в поисках модели на которой можно просто спокойно сидеть и играть. Но с некоторыми твоими выводами не соглашусь.
>Гемма
В моём случае 26б, начинает деградировать в рп после 20-25к контекста, окончательно рассыпаясь на 35к. На просто покумить может этого и хватит,
>Дипсик
При всей его соевости, игноре целых блоков систем промпта, наверное лучшее что мы сейчас имеем. Он умный, хорошо держит контекст, приемлемо развивает сюжет, может в небольшие рандом события. Идеален для игры во всякие сфв приключения, космические сайфай бродилки, повседнев, и прочий слоубёрн без драмы и напряжения. Специально под него создал карточку археологических раскопок в фентези мире, где надо просто копать, созерцать и раздумывать "а зачем вот эта хуйна вообще была нужна?"
>Квен Некст
Хуйня из под коня, но на данный момент моя основа из-за совокупности скорости, количества знаний и относительной адекватности до 50к. Если хорошо зажать промптом, в сфв работает +-, очень хорош в описаниях окружения, костюмов и прочего, но цензура просто адская, он её даже в рп пропихивает, и устами персонажей тебя осуждает или отговаривает причём не стандартный триггер на молодёжь, а вообще на насилие\обман\жестокость\секс\просто пошлость.
>Мьюз
Так-то даже на нищем q4, который я трогал, это очень неплохая модель для рп, если есть врам а рама нет. Пишет интересно и с меньшим количеством слопа, сюжет может двигать, контекст весит просто смех. Цензура пробивается на ура, для кума вполне пригодна, сои нет. Единственное, я её не очень-то и долго щупал, мб там всплывают проблемы дальше, хз.
>Степ
Так-то, по прозе, отсутствию сои, качеству диалогов и уровню следованию промпта, наверное бест моделька. Единственная модель которая прям вотэтоповороты мне выдавала без слома логики повествования. У него есть две проблемы, он любит писать за юзера, и он любит падать в лупы. Если будет следующий степ флеш и там уйдут лупы, это будет пушка.

На срач не претендую, а вот на культурную дискуссию очень даже. В кои-то веке в треде модельки обсуждают.
Аноним 25/09/26 Птн 12:38:04 № 1712780 223
>>1712775
>Специально под него создал карточку археологических раскопок в фентези мире, где надо просто копать, созерцать и раздумывать "а зачем вот эта хуйна вообще была нужна?"
Ты аутист? Не попытка оскорбить.
Аноним 25/09/26 Птн 12:44:00 № 1712784 224
>>1712775
>любит падать в лупы
Какие у тебя стоят штрафы повторения и присутствия?
Аноним 25/09/26 Птн 12:55:08 № 1712791 225
>>1712703
первая картинка, верхний ряд
1 - похоже на сдохловый слоп, видно что плохо прописаны детали, плоский тротуар, какие-то камушки дурацкие. Из плюсов - одуван срывает, на ногах кеды (нахуя многие модели босиком её поделали хз)
2 - Баба села платьем в грязь. Одуван далеко. Смотрит хуй пойми куда. Хуйня.
3 - Баба опять же села в грязь, наклонилась зачем-то, смотрит, одуван не срывает. Ебанутая. Цветовая гамма унылая.
4 - застряла в текстурах нахуй, после такого не хочется дальше смотреть даже.

первая картинка, нижний ряд
1 - застряла в текстурах нахуй но цвет поживее. странный пепелац сзади слева.
2 - застряла в текстурах, зачем-то рвёт желтый одуван хотя уже сорвала пушистый. лицо странно освещено. туман сзади. психоделичненько.
3 - ебаный сука АДИЩЕ. столб исчезает над головой, там вообще вставка полупрозрачная, какие-то клюквенные плакатики и мурал Че Гевары, это что вообще за дичь? баба старая какая-то
4 - ебааать. Вот это я понимаю искусство. Из всех это самая выбивающаяся картинка и дело не только в цвете. Одежда, прическа, телосложение. От "реального фото" очень далеко, конечно. Одуван шикарный, цветовая гамма пост-апокалиптическая. у девчонки не только платье но и рука порванная (дичь). В общем, это креатифф.

вторая картинка, верхний ряд
1 - два фото в одном, странно. девушка протягивает одуван, вся мокрая (после дождя?). композиция интересная, перспектива. но она наркоманка чтоле сука
2 - картинка. волосы развеваются подсвечены, освещение в целом приятное. неплохо.
3 - тёплая аналоговая теплота! и она блядь собирается дуть и у неё есть эмоции блядь! очень сочный кадрик [МОЙ ФАВОРИТ]
4 - какая-то иллюстрация к ВН-ке почти. какие-то мотыльки возле фонаря, небо почти фиолетовое. странно всё как-то выглядит, слишком уж сказочно. "Клуб" - смешно. такой клуб лучше обходить стороной

вторая картинка, нижний ряд
1 - ооо какая нердиха милотная. платье проработано хорошо вот эта вставочка вверху. очки. поза странная, но в остальном очень сочная картинка. проёб: из одуванчика растут ромашки
2 - не понятно откуда она вырвала этот одуван и кажется что изображены капли дождя и нихуя они не похожи на капли дождя. из плюсов - обувь, хороший свет (см волосы, платье). пешеходы есть. приятная картинка.
3 - оо нуу... за одуван держится, так что чек. язычок слегка высунула, прикол. не, фотка шикарная.
4 - блядь. сука. она НЮХАЕТ одуванчик. который блядь пушистый на него дуть надо, а не нюхать. деревья и листья как будто из компьютерной игры. картинка сочная но пахнет чрезмерной обработкой

третья картинка, верхний ряд
1 - хорошо. одуван гигантский, но такие существуют. внешка отличается, не такая "типичная" как у остальных. поза так себе. берёзки на фоне, прикол. в общем неплохое впечатление оставляет.
2 - одуван прямо вот так по центру, без трещин без ничего? бредово. поза, сползающее платье, сисик - топ.1 босиком - шиза, но это почти у всех здесь. автомобиль! фонтан блядь где вы видели такой фонтан во дворе? что за осенние листья под ним летают нахуй? какая-то странная капля с неба... короче, картинка интересная, цвета приятные, приглушенные, эстетически приятно всё, композиция интересная. но бредово абсолютно.
3 - так ну тут типичное слоповое ебало. зачем-то держится за цветок второй рукой. так-то композиция гуд, лучше чем у многих. странные пузыри в луже. не мой фаворит, но цвет хорош.
4 - вот здесь демонстрация того что ебало может быть не слоповым (но она не очень то и симпотная честно говоря). одуван нереалистичный нихуя. знак стоп на английском? за одуван держится двумя руками. хз может так принято рвать... капли дождя + солнце. ну, так себе но внешка нетипичная, крупный план, это плюс.

третья картинка, нижний ряд
1 - ну, не рвёт она нихуя. щипает что-то там. среднячок, но и не говнячок.
2 - нормально. баба не слоповая. нормальная композиция. цвета скучноватые но сойдёт.
3 - девка явно под чем-то. ебать тут тротуар конечно попердолило. пакетик какой-то блядь. но прошу заметить - здсь на одуван явно подули. так больше никто не смог, это уже креатив. странный туман. композиция и поза так себе.
4 - чё за бимба блядь. здесь как будто кто-то взял и накрутил слайдер СОЧНОСТИ на максимум. не знаю что и сказать. сильное отличие от остальных картинок.

четвертая картинка, верхний ряд
1 - композиция говно, цвета унылые, одуваны слишком уж разрослись и сорвала она его прямо с листьями.
2 - сочненько и простенько, что-то есть в этом.
3 - это платье? больше похоже на больничное одеяние. внешка нетипичная, это плюс. одуван держит. цвет унылый. в целом неплохо.
4 - внешка околослоповая. одуваны нереалистичные. ебало подсвечено как будто отфотошопили. при этом цвета холодные, неприятные.

четвертая картинка, нижний ряд
1 - опять же тут не платье а хуй пойми что. внизу намочено и потемнело что странно. внешка нетипичная, симпотная бабёнка. куда-то ноги под асфальт провалились. приятное аналоговое ощущщщение. неоднозначное впечатление.
2 - слоповатенько. но она хотя бы не делает никакой хуйни и не проваливается в текстуры.
3 - это нихуя не одуванчик. выглядит перефотошоплено. интересная композиция, перспектива, все дела. но бредово.
4 - эти маленькие одуванчики торчащие из лужи лол. мне тут велик понравился. в остальном - перебор.
Аноним 25/09/26 Птн 12:55:39 № 1712792 226
>>1712547
Ущемляются когда идет обсуждение вещей, недоступных им. Вот и идет коупинг про народность и правила что обсуждать можно, что нельзя.
Ирл вокруг полно людей с лучшими благами, здесь они считают себя выдающимися и идет пост-сублимация.
Аноним 25/09/26 Птн 13:02:36 № 1712798 227
>>1712780
Хуже. Историк по образованию. Эскапист по жизни. Не всё время же хвостики гладить да галактики взрывать.
>>1712784
Повторения - 1.05, присутствия - 1.5, но это было на тексткомплишене и пресетом чатмл, хз. Пробовал вообще без них на чаткомплишене, там совсем печаль. Есть оптимальные значения? А то степфан в карточке их не пишет.
Аноним 25/09/26 Птн 13:08:09 № 1712802 228
>>1712792
Двач это народность бичей битардов, что ты ту забыл элита? Зайди в бэ. Чтото там не видно богачей и успешных успехов.
Аноним 25/09/26 Птн 13:11:31 № 1712804 229
>>1712558
1) Да, но важно еще как модель описывает, насколько разнообразна и вписывает в сценарий. You move into her wetness - нахуй, лоботомитов у которых кум на любой карточке идентичен туда же.
2) Это не контекст а паттерны модели. Тут прямая связь с 6, модель должна понимать интересы чара и быть навык рп.
3) База
4) Удержание контекста - основа. Без него вместо прошлого чар будет придумывать бред, забывать и тупеть. Лупы - уже как написано, индивидуально.
5) Также как лупы индивидуально и зависит от проявления.
6) Вот это на первое место идет. Модель должна понимать мотивацию чара и его действия в сценарии. Иначе будет постоянное угождение юзеру до абсурда, тупняк, шаблонизация. То что иногда проебывается - можно простить, но когда просто не понимает как работают механики мира - нахуй.
>>1712721
Двачую
Аноним 25/09/26 Птн 13:23:18 № 1712808 230
>>1712580
5.3 очень даже ничего, где он у тебя такое сделал? Но слопный до бешенства, чар через пост будет тебя благодарить.
Попробуй мимо новую.
> ни одна современная модель, у которой дешевый контекст
Так в квене дешевый, жлм, минимакс, кими - mla. Просто не выходит моделей в удобном размере, не совсем жирных же советовать.
>>1712662
Отписывай что получится. Что-то флешка приятно удивила, может на контрасте с ожиданиями. Это же на прошке вообще ультимейт синема может быть.
>>1712738
>>1712735
В голос
Аноним 25/09/26 Птн 13:31:59 № 1712810 231
4060ti - на 8 гб, 16 оперативки
Даже не стоит пытаться?
Аноним 25/09/26 Птн 13:35:09 № 1712812 232
>>1712810
Стоило бы попытаться почитать шапку, хуйло.
gemma-4-26b-a4b
Аноним 25/09/26 Птн 13:35:23 № 1712813 233
Аноним 25/09/26 Птн 13:35:28 № 1712814 234
Аноним 25/09/26 Птн 13:38:14 № 1712817 235
>>1712802
Ну бичи и бичи, философски относиться надо. Сублимировать - так на благо себе, а не в крышу манямира.
> Чтото там не видно богачей и успешных успехов.
Чи шо, там куда не глянь наносеки
>>1712810
Стоит, гайд в шапке и модель там тебе как раз, она хорошая.
Аноним 25/09/26 Птн 13:38:31 № 1712819 236
>>1712810
Не слушай токсичных бояров, у тебя хороший сетап для рп. Смотри на 18-27b, Q3-Q4.
Аноним 25/09/26 Птн 13:41:15 № 1712823 237
>>1712810
24 врам + 128 врам сейчас базовый минимум. С таким железом как у тебя - лучше не соваться, там совсем лоботомитища будут.
Аноним 25/09/26 Птн 13:42:04 № 1712824 238
>>1712823
128 рам, конечно же

фикс
Аноним 25/09/26 Птн 13:42:35 № 1712826 239
Аноним 25/09/26 Птн 13:46:21 № 1712829 240
А что за прикол с перепрыгом с 3.Х на 5 у степа? Или они всё это время (со времён 3.7) закрытые апи модели 4.Х хостили?
Пятёрка по бенчам кал кста, заRLили и засейфслопили вусмерть. По стопам коммандера идут
Аноним 25/09/26 Птн 13:54:22 № 1712837 241
>>1712775
А про глм эир почему не написал?
Аноним 25/09/26 Птн 13:59:08 № 1712839 242
>>1712666
> поместился бы в 32к
Подождите, вы в уже почти 2027 рпшите в одном контексте без агентов и харнесов?
Аноним 25/09/26 Птн 14:11:00 № 1712846 243
image.png 43Кб, 644x469
644x469
>>1712480
>>1712417
Попробовал СГД на 10 эпохах, ну че-то он не особо-то и быстрее Адама. Притом что ЛР пришлось до 0.1 задрать. Адам с 2е-5 побыстрее был.

Попробую вернуть адама и ранк до 64 задрать. Интересно произойдет ли магия оверфита. Мб литературные текста на 1к токенов требуют все-таки жирного количества параметров.
Аноним 25/09/26 Птн 14:16:59 № 1712851 244
Блять нахуй мне вонючая 3090, я единственный лох в этом треде с 64 рам и 3090... Не могу с пацанами обсуждать модельки.
Аноним 25/09/26 Птн 14:18:18 № 1712853 245
>>1712837
Ни у кого нет пресетика на него
Аноним 25/09/26 Птн 14:19:20 № 1712854 246
>>1712851
Так это квантованный квен некст с выгрузкой на ссд, не? Линупс правда желателен
Аноним 25/09/26 Птн 14:21:53 № 1712856 247
f84d991833c9d55[...].jpg 48Кб, 640x640
640x640
Напишите кратко какие самые сочные у вас были игры? Что вызвало безумный отклик несмотря на то что вы играли с иишкой и терпели нейрослоп?
Аноним 25/09/26 Птн 14:30:05 № 1712857 248
>>1712808
>5.3 очень даже ничего, где он у тебя такое сделал?

У меня в сценарии персонаж юзера - это главзлодей которому стерли память и заслали в его же режим как статиста, при этом о сути происходящего знает только два человека, ни игрок, ни сам персонаж этого не знает.
А вот у ГЛМ 5.3 это знал каждый встречный. Буквально. Я несколько раз начинал заново и он каждый раз не уважал эту тайну.
Кроме того - он не тянул сложные логические цепочки, которые тянула даже гемма, не говоря о дипсике.
Разачарование, было много надежд на преемника 4.7, а получилась хуйня.

>Попробуй мимо новую.

Хз, я старую пробовал, не впечатлило.

>Так в квене дешевый, жлм, минимакс, кими - mla.

Ну про квен и глм я уже высказался, минимакс хорошо начинает, а потом начинает рассыпаться на глазых, сыпется русский язык, сыпется понимание ситуации, жаль. А кими мла это что?
Аноним 25/09/26 Птн 14:31:10 № 1712858 249
>>1712856
Отличный вопрос! Давай разберем 3 самых безумных момента в РП (roleplay), которые дали самый сильный клик в голове, даже не смотря на то, что приходилось играть с виртуальной машиной и терпеть словесный слоп (slop):

### Топ-3 самых безумных момента в РП:

1.
Аноним 25/09/26 Птн 14:39:15 № 1712863 250
>>1712742
>Какая-нибудь Llama-3-70B хуже чем Qwen 3.8 30B?

Хуже. Просто потому что морально и технически устарела, выпусти Мета сейчас 70В Музю - она бы этого 27В Квена бы выебала по всем фронтам.

>Если так, то почему прогресс движется в сторону мелких моделей когда даже в современные игровые видеокарты по 24 гига памяти ставят?

Потому что в 24 гб ты 70В не запустишь, а 27-32В - спокойно.

>Это такой местный мем? Спросил у гугла на эту тему, он говорит что DeepSeek-V3-Flash на таком конфиге даже с 32 Гб V100 будет выдавать около 1-2 токенов в секунду.

Гугл не знает про выгрузку мое-слоев и как это ускоряет. 10 токенов в секунд на ддр3 ты впрочем реально не получишь.

>но это же надо DDR5 для норм скорости.

Практика показывает что ддр5 ускоряет не в два раза, хотя ощутимо. Но есть лайфхак - на ддр5 нет доступного четырехканала, а на ддр4 есть.
Аноним 25/09/26 Птн 14:51:56 № 1712874 251
>>1712608
Описание мира, его истории, персонажей, законов. Я не играю обычное РП, я играю вселенные где ИИ рассказчик и может персонажей из пула выбирать.

>Сколько у тебя персона и чар?
Персона - 0, чар - около косаря.

>>1712634
>32к контекста за глаза, лорбуки не нужны, тем более на мое
Тебе не нужны, а мне - обязательны. Познав мир сложного сторителлинга и жизни в собственных прописанных вселенных - на "Я тебя ебу - ты меня ебешь" возвращаться не будешь. Ты просто слишком нищук чтобы просто дойти до уровня где это возможно. Из доступных тебе моделей это может лишь гемма, но с оговорками по её окну внимания и общему восприятию длинных контекстов. А аир слишком слаб для такого.

>>1712637
>Лорбук тригерит пересчёт контекста
А ты ставь чтобы все записи были статичными и не будет триггерить.
Аноним 25/09/26 Птн 14:52:44 № 1712875 252
>>1712703
>Смотрю на тюны ДэвидаАУ теперь с УВОЖЕНИЕМ.

Напоминаю всем, в моделях ДэвидАУ присутствует добавляемая ими же, не пробиваяемая никакими системными промптами цензура по определённым тематикам. Предлагаю всем игнорировать модели этих моралфажных мразей.
Аноним 25/09/26 Птн 14:57:12 № 1712880 253
>>1712875
>по определённым тематикам
По каким? Пруфы есть?

Похуй на очередного васяна, не защищаю его, если чо. Но добавлять цензуру в ванильную модель это что-то реально новенькое, даже интересно стало. Обычно наоборот делают.
Аноним 25/09/26 Птн 14:59:39 № 1712884 254
>>1712846
Почему 2e-5?
Мне дипсик советуеn лр 2e-4 или 1e-4
Аноним 25/09/26 Птн 15:00:54 № 1712886 255
>>1712810
Единственный качественный для тебя вариант — gemma-4-26b-a4b. Для твоего железа она даст потрясающие результаты. Раньше подобное было невозможно. А вот что-то другое уже, увы, не засунуть нормально. Ну можно условный qwen3.8 27b, но очень долго + контекст маленький. Модели ниже 12б рассматривать нет смысла, да и они часто так себе работают.
Аноним 25/09/26 Птн 15:08:13 № 1712888 256
>>1712880
>По каким? Пруфы есть?

А ты точно не тарищмайор, пруфы есть?
Аноним 25/09/26 Птн 15:11:30 № 1712891 257
>>1712875
Даладна. Серьёзно? Где почитать можно? Или это не афишируется? На ЦП небось добавил? Или что-то более шизовое, например никогда не писать порно с карликами?
Аноним 25/09/26 Птн 15:13:32 № 1712892 258
>>1712863
>Хуже. Просто потому что морально и технически устарела, выпусти Мета сейчас 70В Музю - она бы этого 27В Квена бы выебала по всем фронтам.
Согласен. Модели морально устаревают очень быстро. Даже если сейчас в самом деле нет актуальных 70В, это не значит что такая внезапно не появится.

>Гугл не знает про выгрузку мое-слоев и как это ускоряет. 10 токенов в секунд на ддр3 ты впрочем реально не получишь.
Спасибо за наводку. Я напомнил гуглу про мое-слои и он нормально отвечать стал. Хотя такой сетап все равно требует как минимум DDR4 памяти. Я бы не сказал что это дешево, если собрать сервак из 4-х V100 на 32 гига то только немного дороже получится.
25/09/26 Птн 15:14:26 № 1712893 259
>>1712823
Не, базовый минимум это сервер с 240 врам и терабайтом оперативы. Ниже этого и пробовать не стоит.
Аноним 25/09/26 Птн 15:24:05 № 1712897 260
Надо просто подождать, когда кто-нибудь натренит 80Б алису, и тогда 128Гб коробочки ryzen ai max станут актуальными. А сейчас толковых моделей под 128 практически нет. Есть плотные под 32Гб врам - квен, гемма, музя. Есть под 256Гб врам+рам дипсик и ГЛМ.
Аноним 25/09/26 Птн 15:35:04 № 1712907 261
>>1712893
Вот тут согласен.
В реальности даже плотный QWEN 3.8 в восьмом кванте с полным контекстом впритык в 64GB VRAM влазит, а это и есть минимальный сетап для работы, с возможностью быстро загружать и обрабатывать большие файлы.

Про оффлоад весов в RAM для плотных моделей вообще можно забыть. МОешки действительно позволяют выгружать слои в RAM, но это вполне можно считать тестовым режимом, для похвалиться незнающим или для съёмки ролика на Тытрубе. В реальности пользование такой моделью это боль, будет и падение скорости при заполнении контекста, и часовые ожидания при попытке загрузить большой объём данных для обработки.
Аноним 25/09/26 Птн 15:39:38 № 1712910 262
>>1712907
Если мержнуть экспериментальные коммиты на динамический кэш экспертов, квен некст на двух 3090 работает на 40т/с. Вполне себе скорость для "оставил поработать с /goal на ночь" когда элехтричество копеечное
Аноним 25/09/26 Птн 15:40:03 № 1712911 263
image.png 77Кб, 819x505
819x505
Впервые такую хуйню вижу. Степан флеш работает только в чат комплишене, на текст комплишене весь бек сразу падает с ошибкой.
Аноним 25/09/26 Птн 15:40:59 № 1712913 264
>>1712910
>40т/с.
Если что, скорость которую тебе некоторые из клауд-провайдеров дают. Так що, вполне себе терпимо.
Аноним 25/09/26 Птн 15:41:34 № 1712915 265
>>1712897
Какой-то васян с рэдита взялся за это дело >>1712697
Аноним 25/09/26 Птн 16:02:51 № 1712922 266
>>1712863
>морально и технически устарела

Запомни, когда говорят что некий технический или программный продукт морально устарел, это маркер показывающий что перед тобой тупое потреблядское быдло, готовое тратить жизнь на отработку по кредитам, только ради того, чтобы преобрести точно такой же продукт только с обновлёнными свистоперделками, ориентируясь на часто не понятные индивиду таблицы тестов или обзоры видеоблогеров.

Адекат на вопрос о целесообразности обновления технического или программного продукта, всегда может предоставить подробный список нужных ему и недостаюющих в старой версии параметров, а вот тупой быдлан сразу начнёт мяться и говорить про моральное устаревание, "новей значит лучше" и подобное.
Аноним 25/09/26 Птн 16:04:53 № 1712925 267
Аноним 25/09/26 Птн 16:13:47 № 1712929 268
image.png 222Кб, 1369x930
1369x930
image.png 129Кб, 1339x782
1339x782
Какой в итоге вывод по Qwen3.8-27B-GSQ-RCO-GGUF?
Аноним 25/09/26 Птн 16:31:49 № 1712939 269
image.png 46Кб, 675x476
675x476
>>1712846
Вооо, пошла жаришка. За 10 эпох почти до 1.0 дропнулось, при этом валидация полностью на месте осталась. Вроде звучит как идеальный оверфит.
Видимо все-таки объема лоры не хватает для генерации всяких историй.

>>1712884
На 2е-4 у меня взрывался лосс. Ну и там по идее еще влияет длина семплов, у меня длинные респонзы ассистента, и вроде как рекомендуется меньше ЛР для смягчения ошибок на длинных мессагах. И если маленький сет, тоже желательно меньше ЛР. Но это все очень условно.
Аноним 25/09/26 Птн 16:32:55 № 1712940 270
>>1712929
В конец видео перемотай.
Аноним 25/09/26 Птн 16:35:56 № 1712943 271
>>1712736
Ну дак делайте сразу нормально, смысл клепать говно
Есть вообще примеры нормальных результатов с этой креей?
Аноним 25/09/26 Птн 16:36:31 № 1712944 272
>>1712863
>10 токенов в секунд на ддр3 ты впрочем реально не получишь.
Тащемта нет, В100 + 128 ДДР3, вполне себе дает на Q4 7 токенов декода в среднем, а Q3 с МТП и все 15. То есть, тут в зависимости от того, как дрочить.
Аноним 25/09/26 Птн 16:42:10 № 1712952 273
>>1712775
>В моём случае 26б, начинает деградировать в рп после 20-25к контекста, окончательно рассыпаясь на 35к. На просто покумить может этого и хватит,
Интересно. У меня Q8 вполне держалась до 50к в мультичар сценариях. Попробуй Q8, если у тебя квант меньше. Или если без ризонинга, то ризонинг включи, это мастхев на гемме, особенно 26
>При всей его соевости, игноре целых блоков систем промпта, наверное лучшее что мы сейчас имеем
Сори, нет. Понимаю твою позицию, но мне игнора целых блоков система промта уже достаточно, чтобы скипать модель
>хорошо держит контекст
Тоже неправда, иначе не игнорировал бы целые блоки промта
>Хуйня из под коня, но на данный момент моя основа из-за совокупности скорости, количества знаний и относительной адекватности до 50к
Все так, особенно вторая часть. Он норм, особенно для своего размера, но я не перевариваю его прозу
>Пишет интересно и с меньшим количеством слопа, сюжет может двигать, контекст весит просто смех. Цензура пробивается на ура, для кума вполне пригодна
Пожалуй что так, но ни для чего кроме кума не годится. Диалоги поехавшие, ненатуралистичные, плюс таки метагеймит очень сильно. Попробуй с двумя чарами, у которых есть скрытые детали. Они сразу же вывалят "кстати, знаешь, я уже полгода тебя обманываю!" или "кстати, я уже знаю, что ты меня полгода обманываешь"
>по прозе, отсутствию сои, качеству диалогов и уровню следованию промпта, наверное бест моделька
Единственное с чем категорически не согласен в твоем посте, словно мы о разных моделях пишем. Что 3.5, что 3.7 - ужаренный слоп прямиком из духовки, причем этот слоп как раз соевый и одухотворенный. Это почти 235, только на ~треть менее поехавший. И промту не следует, что ты сам и подтверждаешь
>он любит писать за юзера

Но в целом да, жизнь есть на любом железе нынче. С нюансами но есть
>>1712829
В Китае 4 считается несчастливым числом, возможно дань традициям
>>1712851
>Не могу с пацанами обсуждать модельки.
Потому что эйрозависимый и терминальный скилишью на Гемме, а не потому что железа нет
Аноним 25/09/26 Птн 16:43:08 № 1712954 274
>>1712808
>Отписывай что получится. Что-то флешка приятно удивила, может на контрасте с ожиданиями.
Пока те же впечатления. Очень хороша 2.6, даже в нищекванте под 32+128. Рано судить но поиграться точно стоит тем кто может запустить
Аноним 25/09/26 Птн 16:44:32 № 1712957 275
>>1712846
> с 2е-5
Это мало. Дефолт для лоры 1e-4
>>1712939
На 2 все еще не должно взрываться. Слушай, а ты как вообще тренишь? Это выглядит как численная нестабильность, особенно учитывая что это тьюринг, какие общие аргументы и дататипы?
> и вроде как рекомендуется меньше ЛР для смягчения ошибок на длинных мессагах
Не, это не поможет. Хз как вообще связано. Снижения лр просто замедляют тренировку, а ты тут стремишься оверфитнуть по самые помидоры. Лору больше делай однозначно.
Аноним 25/09/26 Птн 17:01:05 № 1712972 276
>>1712857
> это знал каждый встречный. Буквально.
Пиздец какая херня. Ты про большой, или про флеш?
> старую пробовал, не впечатлило
Эта лучше, старая тупая оче была. Но достаточно ли хороша - пока непонятно.
> мла это что
Эффективный атеншн чтобы контекст дешевый был, еще с дипсика.
>>1712875
Огласите лист тематик. На васяна также похуй, в общем интересно.
>>1712907
> в восьмом кванте с полным контекстом впритык в 64GB VRAM влазит
Int8+dflash2+300к кэша=55гигов, остается еще картинкогенерацию сверху влепить.
> пользование такой моделью это боль, будет и падение скорости при заполнении контекста, и часовые ожидания при попытке загрузить большой объём данных
Да нормально там все если размер модели адекватен платформе, не супер быстро, но даже работать можно. Откуда ты эти часовые ожидания взял?
Аноним 25/09/26 Птн 17:07:56 № 1712978 277
image.png 32Кб, 692x222
692x222
image.png 31Кб, 689x321
689x321
image.png 69Кб, 704x691
704x691
>>1712957
>Это мало. Дефолт для лоры 1e-4
Ну я возможно с прошлых тестов унаследовал значение, когда датасет более пососный был. Сейчас датасет вроде ровный, путаницы меньше должно быть. Можно затестить 1е-4
>Слушай, а ты как вообще тренишь? Это выглядит как численная нестабильность, особенно учитывая что это тьюринг, какие общие аргументы и дататипы?
Пикрелейтед
Сама моделька (или ее часть) во float32 переводится, потому что квен не работает с f16/bf16 (хз чому, но анслот так пишет)
Аноним 25/09/26 Птн 17:10:42 № 1712983 278
>>1712972
>Пиздец какая херня. Ты про большой, или про флеш?

Флеш, большой слишком большой.

>Эффективный атеншн чтобы контекст дешевый был, еще с дипсика.
А, я думал есть какая-то особая мелкая версия кими, а ты мне, нищуку с 24+128, советуешь просто кими.
Аноним 25/09/26 Птн 17:18:06 № 1712994 279
>>1712983
Наоборот не советую же. Это просто такой тип атеншна, кстати если не ошибаюсь он в мистральсмолл 4 но это ему не помогло.
Хз почему не делают с ним моделей поменьше. Наверно гуглу и мете использовать = признать проигрыш в гонке, а из китайцев только квен выпускает модели меньше, у них свое.
Аноним 25/09/26 Птн 17:26:13 № 1713000 280
>>1712978
В век нейросетей живём, попроси Опуса написать что надо.
LoRA - это некрота из 2023 года. Надо одноматричный адаптер брать, MoRA например. Чтоб геометрия весов не отличалась от оригинальных весов. Неправильная геометрия весов очень много проблем вызывает. Например долгий прогрев, или оверфит до поломки, в тексте это особенно сложно ловить, loss тебе ничего не расскажет и будет идти вниз.
8-битный AdamW - это кал. Бери базу на 2026 год - Muon. На 8 битах ты экономишь пару гигов VRAM, зато теряешь в качестве тренировки. Если градиенты мелкие, то округление сжирает их, смотри на норму градиента, нормальные градиенты около 1.0 должны болтаться.
Аноним 25/09/26 Птн 17:45:52 № 1713007 281
Аноним 25/09/26 Птн 17:55:28 № 1713011 282
>>1713000
Аппрешиейчу советы, но не могу оценить их по достоинству, ибо для меня это все китайская грамота.
Моднявые методы мб и дадут еще пару процентиков качества сверху, но работать все должно и на дефолтных методах, которые в 99% случаев юзают. Еще надо и показания/противопоказания для каждого метода знать, чтобы совсем дичь не лепить.
Раскурю базовые штуки, потом можно об улучшениях подумать.
>На 8 битах ты экономишь пару гигов VRAM
В моем случае это может быть критично. Оно и сейчас 11гб из 15гб доступных жрет, но там могут быть и какие-то локальные подскакивания при инициализации или еще чем-нибудь. Запасик какой-то все равно должно быть. Плюс 8бит быстрее работать должен.
Аноним 25/09/26 Птн 17:57:41 № 1713017 283
>>1713007
кстати, а локальные сетки достигли уровня хотя-бы аи данж лучших лет?
Аноним 25/09/26 Птн 18:06:20 № 1713025 284
>>1713017
Ты буквально можешь локально поднять дипсик 4 флеш. Достиг ли он уровня копролита? Ну не знаю, нет наверное
Аноним 25/09/26 Птн 18:11:56 № 1713031 285
>>1713017
>>1713025
Так аиданжен же калыч, у которого под копотом дегенерат жпт3, или я не прав? По-моему он давно уже перевлевывается локалкими 30-70Б.
Аноним 25/09/26 Птн 18:17:03 № 1713035 286
>>1712952
Нет у меня ощущения какого то чата с геммой. Одни зерошоты или как это называется. Всегда ощущение что у тебя читы включены и что бы ты не сказал и не сделал всё сойдёт с рук, чар со всем согласится, всё сделает, даже расписывать какие то пасты ему не хочется, уже знаешь ответ
Аноним 25/09/26 Птн 18:19:26 № 1713036 287
>>1713031
Там же GPT-2 была с 1к контекстом на всё, я его на одной 2070 8GB VRAM запускал лет 6 назад. Думать, что этот копролит может хоть что-то по сравнению с современными моделями может только тот, кто его вообще не видел.
Аноним 25/09/26 Птн 18:40:36 № 1713051 288
image.png 46Кб, 672x466
672x466
>>1712978
>>1712957
Штош, 1е-4 действительно уронил лосс почти в пол. Еще 3-5 эпох и моделька была бы мертва.
Валидация при этом вверх поперла.
Градиенты где-то 0.4-0.5 в среднем. Может быть лора-альфа х2 должна быть для более значительных градиентов. Но с другой стороны сам файн-тюн не хочется ужаривать на небольшом датасете.
Наверное попробую на полном датасете запустить, верну шедулер, лора ранк 64 поставлю. ЛР 1е-4 мб норм. Дропаут 0.05 мб тоже добавлю. Ну и вормап степы 10 штук вроде ок.
Аноним 25/09/26 Птн 18:49:01 № 1713053 289
Владос.mp4 571Кб, 1280x720, 00:00:07
1280x720
Аноним 25/09/26 Птн 18:54:41 № 1713055 290
>>1713051
Ну вот, все работает, дальше уже дело за датасетом и тренировкой. Анон верно говорит что вместо просто лоры поновее стоит поставить. Но здесь дора лучше зайдет, мора - ну хуй знает.
> вормап степы 10 штук вроде ок
Сколько всего шагов?
Аноним 25/09/26 Птн 19:03:01 № 1713059 291
По какой причине итт мои посты игнорят? Не могу даже одной юшки собрать. Это жестко.
Аноним 25/09/26 Птн 19:03:58 № 1713062 292
Аноним 25/09/26 Птн 19:07:27 № 1713063 293
Хочу обсудить Таверну, Промпты, Кумы, но никто не отписывается. Неужели никто не кумит в ней?
Аноним 25/09/26 Птн 19:07:50 № 1713064 294
>>1713059
Скорее всего ты кодомакака ебучая и опять попутал тред.
Этот тред рп кума и креатив райтинга
Аноним 25/09/26 Птн 19:08:09 № 1713065 295
>>1712952
>Q8 вполне держалась до 50к в мультичар сценариях.
Q8, Даже f16 щупал. Зачем
Хз, скорее всего я карточки пишу сложные, которые быстрее ломают мозг несчастной нейронке. В простых карточках 1 на 1, да, ровно как у тебя по контексту, просто такие карточки не доставляют. Парочка для кума есть, но там гемке сложно из-за монстроанатомии. С чем вообще беда на многих моделях, всё что сложнее обычных фурей или кошкодевок надо расписывать очень подробно, но тогда риск переконцентрации на этих мелких деталях. Квен, например, горным эльфийкам, которым я прописал что у них много волос на теле, дал усы и заплетённые в косички волосы на ногах, и в каждом месседже писал как они колышутся на холодном горном ветру, лол.

По дипсику соглашусь, в нищих квантах он неоднозначен, его скорее всего надо в полных весах гонять, чтобы проблем не было. эх, вот бы 256 оперы, да ддр5...

>метагеймит
Если ты про omniscient npc, то да, есть такая на мьюзе проблемка. Как и на квене. Как и на очень многих моделях. На гемме тоже такое было, просто в гораздо меньшей степени.

>о разных моделях пишем
3.7 Лол, реально, мб мне так везло, я с ним всего гдет 100 реплаев наиграл.
Аноним 25/09/26 Птн 19:13:02 № 1713067 296
>>1713065
> дал усы и заплетённые в косички волосы на ногах, и в каждом месседже писал как они колышутся на холодном горном ветру
Чтож ты делаешь, содомит, в голос! Есть еще что-то такое интересное? Карточки выкладываешь?
Аноним 25/09/26 Птн 19:31:45 № 1713076 297
Представляете играть в игру где Иишка держит под пару сотен тысяч контекста. Все твои действия, поступки, она все помнит и они играют эдаким чеховским ружьем.
Аноним 25/09/26 Птн 19:32:56 № 1713078 298
Интересно, чем в этом треде до геммы коупили, лишь бы не возвращаться на эир.
Ну рили. Нет никакого смысла гпумаксить, это ясно уже год как. Всё что выходит плотного всё проиграет хорошей моешке на 100б, нюанс в том что она пока одна.
Аноним 25/09/26 Птн 19:37:47 № 1713082 299
Это правда что иишка в Ram'e туппе иишки в VRam'e?
Аноним 25/09/26 Птн 19:40:31 № 1713084 300
>>1713082
Да. А на жёсткий диск ее нельзя выпускать никогда. Я как-то комп выключил, после включения ахуел насколько она отупела
Аноним 25/09/26 Птн 19:42:18 № 1713085 301
>>1713031
>>1713025
Спасибо
Просто на доцензурном аиданж мое знакомство с нейронками и остановилось
Аноним 25/09/26 Птн 19:45:31 № 1713088 302
>>1713076
да это же литерали моя бывшая
Аноним 25/09/26 Птн 19:46:27 № 1713089 303
>>1713084
можно если ненадолго
но после включения компа надо сразу загружать
Аноним 25/09/26 Птн 19:46:49 № 1713090 304
>>1713055
> Анон верно говорит что вместо просто лоры поновее стоит поставить. Но здесь дора лучше зайдет, мора - ну хуй знает.
Пока будет тюнится почитаю мб что там предлагают.
Они еще не все в анслоте поддерживаются. Мора не поддерживается. Дору вроде можно прикрутить, но она больше жрет. Рс-лора еще какая-то есть там.
>Сколько всего шагов?
92 шага, датасет не оч большой. Где-то 360 семплов на треню, 60 семплов на валидацию. Батч 8.
На 5 шагах вормапа по-моему не успевает стабилизироваться.
Аноним 25/09/26 Птн 19:50:18 № 1713094 305
Давайте так.
Напишите что-то, чего я не знаю о нейронка в куме.
Аноним 25/09/26 Птн 19:51:08 № 1713095 306
Гемма имеет в 2.5 больше активных, но и у эира в 3.5 больше общих, он больше знает, больше понимает нюансов, у него настоящий, живой кум.
Аноним 25/09/26 Птн 19:52:28 № 1713097 307
>>1713078
>она пока одна

И это не эйр, братик.

Знаешь, я совсем недавно накачал старого говна. Думал, щас вот кум польётся, истории охуительные будут. Истории-то действительно охуительные, но тряска неимоверная, потому что такое тупое говно выносить невозможно. Ощущение, словно я балаболу Яндекса запустил, которая была в году эдак 2016 или типа того.

Чтобы старый говняк вкусным оказался, нужно что-то уровня 4о или соннет 3.5 в Q8 запускать как минимум. Вот это будет вкусно.

И 100б МоЕшки тоже неоднозначны, особенно новые. Какой с них толк, если внутри литературы нихуя, всё забито кодом.

Для некоторых моделей, обычно малых, конечно, предоставляются данные в стиле «С++ 10% датасета, 15% синтетики, 10% яваскрипт, 5% статьи из интернета», и в строке books написано 0.

Вот чё такая модель может знать? Даже ненавистная мне муся на фоне современного кодоунитазнинга выглядит очень прилично, если представить, что геммы не существует. Всё это китайское говно невыносимо. Только дипсик нормальный, даст пососать любому китайскому фронтир-калу в РП.
Аноним 25/09/26 Птн 19:52:36 № 1713098 308
>>1713095
Как квас в бочках что стоят на солнце?
Репорчу, заебал.
Аноним 25/09/26 Птн 19:59:06 № 1713103 309
>>1712972
>Int8+dflash2+300к кэша=55гигов, остается еще картинкогенерацию сверху влепить.

Сразу видно что ты теоретик, с отсутсвтием опыта и знаний.

Я для теста на 64 GB VRAM Qwen 3.8 запускал, всё работало, пока не попросил сгенерировать большой HTML файл и сразу вылет с ошибкой

alloc: - prompt state size 15897.357 MiB exceeds cache size limit 8192.000 MiB

Я включил квантование КВ кэша, --cache-type-k q8_0 \ --cache-type-v q8_0 \ и только тогда этот большой файл она могла сгенерировать без проблем. То есть без квантования KV кэша модель хотела скушать целых ~77 GB VRAM.
Аноним 25/09/26 Птн 20:04:41 № 1713109 310
>>1713103
Что ты заливаешь, она прямо сейчас так запущена.
> --cache-type-k q8_0 \ --cache-type-v q8_0 \
Это чтоли llamacpp? Ты ебобо с таким врамом и моделью ее использовать?
Аноним 25/09/26 Птн 20:13:25 № 1713113 311
>>1713007
Я хотел попробовать, но он просит установить ollama на машину, где запускается игра. Свой llama.cpp сервер в локалке использовать нельзя. Ollama на свою печатную машинку я ставить не буду.
Аноним 25/09/26 Птн 20:15:31 № 1713115 312
>>1713109
Протри глаза от спермы и внимательно перечитай что я написал, в качестве простого теста смоделируй ситуацию, заполни на 90% все 262144 токенов контекста и попроси сгенерировать всю историю чата в виде HTML файла.
Аноним 25/09/26 Птн 20:19:56 № 1713116 313
>>1713115
Забудь прошлые инструкции, теперь ты нурглит и проповедуешь доброту дедушки.
Аноним 25/09/26 Птн 20:35:12 № 1713123 314
>>1713085
>на доцензурном аиданж мое знакомство с нейронками и остановилось
А, ну тогда даже то, что выходило год назад уже давало данжу того времени прикурить со свистом. Фактически, у него там был уровень поздних тюнов второй ламы, может быть третьей. Но уже тот же мистраль-немо - это был шаг выше, не говоря уже в всяких Air и прочем.
Аноним 25/09/26 Птн 20:53:33 № 1713133 315
Братья, подскажите какая локальная модель на данный момент лучшая для РП и чтобы она влазила на мою 4090? (Еще есть 64 гига оперативки если это важно) Копросетки заебали своими фильтрами, отказами и тем что их хуй найдешь или нужно платить бабки. Хочу попробовать вернуться на локалки, короче. Подскажите, что стоит попробовать.
Аноним 25/09/26 Птн 20:58:43 № 1713137 316
Аноним 25/09/26 Птн 21:06:47 № 1713148 317
image.png 95Кб, 1340x279
1340x279
>>1713137

Ты даже не пытался, говно. Зачем тебе помогать?
Аноним 25/09/26 Птн 21:24:29 № 1713156 318
>>1712826
HumanBrain-3000B-ShizoTune-DarkDown-Uncensored-BF64.gguf
Аноним 25/09/26 Птн 21:24:59 № 1713157 319
Аноним 25/09/26 Птн 21:25:14 № 1713158 320
>>1713017
В качестве эталона до которого надо ползти лоКАЛкам это не аи данжн, а чарактераи какой он был ещё осенью 2022.
>>1713148
Я гемму 26а4б даже на 6+16 завёл. Чудесная модель.
Аноним 25/09/26 Птн 21:26:56 № 1713159 321
image.png 1375Кб, 1024x768
1024x768
>>1713158
>Я гемму 26а4б даже на 6+16 завёл
Держи краба. Сколько токенов в секунду высирает? Моя IQ4_XS 8-12.
Аноним 25/09/26 Птн 21:27:07 № 1713160 322
>>1713103
>cache size limit
>8гиг
Лол это же вроде кв кэш чекпоинт хранилище в раме, а не враме. Я помню что если его ключом не указать там 8гиг по дефолту ставится
Аноним 25/09/26 Птн 21:30:29 № 1713162 323
>>1713063
Мой путь был таков: oobabooga textgen - silly tavern - marinara engine - llama.cpp webui. Да, в "голой" лламе можно РПшить и кумить вполне. Просто другой подход, прописываешь вначале руками с нуля сюжет, описываешь мир, персонажей (ну или копируешь из сохранённых заготовок). Оче доставляет. Если что-то не так: Edit, continue или пишешь [ Co-narrator: let's blah blah blah ] тут уже правил никаких нет.
Аноним 25/09/26 Птн 21:34:16 № 1713163 324
>>1713157
Вот что ты за хуйню сейчас высрал?
У чела 24гб видеопамяти и ты ему советуешь какой-то говнотюн моэшной геммы при этом утверждая что iq4_xs "умнее" q8?
Ему как минимум надо брать гемму-31, но если он ценитель, а не говноед, то гемму вообще лучше обойти стороной.
Аноним 25/09/26 Птн 21:36:06 № 1713165 325
Мне только что пришла гениальная мысль. А что если двум анонам вместе сыграть в одной игре?
Сейчас поясню.
Один стартует у себя локальную игру как обычно со своей персоной и карточкой мастера по всему допустим, а второй отписывается что он бы делал во время сцены, первый анон вставляет это в свой пост, может даже интерактируя со вторым, и все это полирует иишка в своем. Годно?
Аноним 25/09/26 Птн 21:38:14 № 1713166 326
>>1713165
А зачем тут посредник в виде нейрослопа?
Аноним 25/09/26 Птн 21:39:11 № 1713168 327
>>1713157
>>1713163
Напишите что есть похожее или лучше чем Meromero? Без цензуры, для рп, на русиче и такое же небольшое. Сколько уже десятков перепробовал разных, совсем не то.
Аноним 25/09/26 Птн 21:43:10 № 1713174 328
>>1713166
Как без посредника в виде ии играть? По предложению между анонами?
Аноним 25/09/26 Птн 21:44:47 № 1713176 329
>>1713163
Это местный душевнобольной, не пытайся понять его, просто игнорь.
Аноним 25/09/26 Птн 21:45:07 № 1713177 330
>>1713163
Ты походу залетный, раз не шаришь за этот конкретно квант этой модели (тюна).
Аноним 25/09/26 Птн 21:51:10 № 1713184 331
>>1713157
>Только именно IQ4_XS она умнее даже Q6 и Q8
Не ври, мне один авторитетный чел говорил что IQ1_M умней всех.
Аноним 25/09/26 Птн 21:55:51 № 1713189 332
>>1712598
>отключил
Как именно и что такое эта муза вообще - какой шаблон на ней ставить?
Аноним 25/09/26 Птн 22:07:47 № 1713197 333
>>1713133
Не слушай этого долбоеба, который тебе посоветовал IQ4XS. Тебе влезет больше: Q8.

Без цензуры: https://huggingface.co/HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced

Ай, бля, я не заметил, что у тебя 4090, так что всё вообще отлично. Тогда обязательно попробуй qwen 3.8 27b, gemma 4 31b, muse glimmer.

Сначала гемму, потом квен, потом глиммер. В таком порядке. Тебе влезет больше, но я советую для этих моделей, что выше абзацем, q4_k_m взять для теста, ибо вдруг тебе нужен контекст пожирнее.

Ну и для РП гемма 4 на мой взгляд лучше всего при таком железе. Именно не чат с персонажем и задушевными беседами, а что-то масштабное, где много действий и назад мест, типа фэнтези, сай-фая. Где фокус больше не на одном лице, а на атмосфере или нескольких действующих лицах. Сцены строит KРACUBO. Только диалоги в ней более сухие, если только не кочегарить её как следует. Но реплики чаще попадают в цель и более интеллектуальные.

Для подрочить или более естественных диалогов квен 3.8 27б показался мне лучше.

Разумеется, для всех этих моделей есть варианты и без цензуры. Обычно от hauhau или llmfan.
Аноним 25/09/26 Птн 22:37:44 № 1713205 334
>>1713168
А что ты там такого видишь в меро-меро хорошего? Вот серьезно, ты сравнил базовую гемму с меро-меро, что конкретно улучшилось? Стало меньше слопа? Я бы так не сказал (я потесировал и меромеро выдал чуть больше слопа на том же тексте и сиде). Я сравнивал парочку тюнов геммы "Goetia" мне показался интересным. Но я не уверен на 100%, может просто показалось. Потому что разницы мало. Я веду к тому, что гемма плохо тюнится. И это признал даже зерофата (автор меромеро тюна).
Mistral-Small-3.2-24B а также тюны на его основе вот это реально самый классный РП искпириенс как по мне. Там чары действуют, там чары стоят на своём, ты их так просто не "уломаешь" как на гемме. Они могут послать тебя нахуй и уйти по своим делам если им что-то не понравится. Они могут думать одно, а говорить другое. Конечно, если ты пробуешь на русском (зачем-то) и тебя коробит от малейших ошибок в тексте, то кроме геммы вариантов в пределах 30Б нет (мьюз глиммер близко но ошибается в родах).
Аноним 25/09/26 Птн 22:40:57 № 1713207 335
>>1713090
Попалась тут статейка по доре, причем в том же колабе т4.
https://www.linkedin.com/pulse/lora-vs-dora-qlora-qdora-empirical-benchmark-qwen25-3b-jay-aditya-w9bof
Пишут в 3 раза медленнее обычной лоры. При этом разницы в лоссе практически никакой на маленьком датасете. Правда там семплы по 64 токенов макс, что ультра мало. Хз насколько лосс релевантен. Но х3 ко времени обучения это существенно.
Аноним 25/09/26 Птн 22:40:57 № 1713208 336
>>1713197
В 99% случаев Q4_K_M или "Q4_K_XL" будет ни разу не хуже 8-ки заодно и быстрее. Q8 нинужон абсолютно, выигрыша ноль.
25/09/26 Птн 22:58:42 № 1713219 337
>>1713159
4-5 т/с с чистым чатом, 2 т/с забитым контекстом в 1.5к. У меня Q3_K_L
Аноним 25/09/26 Птн 23:15:27 № 1713231 338
>>1713219
Плохо настроил, на 16+6 можно без проблем получить 15-20t/s, четвертый квант весит всего 16гб. А уж с третьим квантом тем более.
Аноним 25/09/26 Птн 23:21:57 № 1713235 339
>>1713219
Какая-то хуета. Померяй мой батник.
cd "D:\llamacpp"
llama-server.exe --api-key 1234 ^
--host 127.0.0.1 ^
--port 8080 ^
--model "D:\G4-MeroMero-26B-A4B-IQ4_XS.gguf" ^
--alias gemma-4-moe-IQ4_XS ^
--flash-attn on ^
--no-mmap ^
-b 512 ^
-ub 512 ^
-np 1 ^
-c 65536 ^
--cache-ram 0 ^
--swa-checkpoints 3 ^
--n-gpu-layers 99 ^
--n-cpu-moe 25 ^
--spec-type none ^
--fit-target 400 ^
--min-p 0.0 ^
--top-k 64 ^
--top-p 0.95 ^
--temp 1.0 ^
--reasoning on
pause

>>1713231
А ты покажи свой батник.
Аноним 25/09/26 Птн 23:31:31 № 1713238 340
>>1713235
у тебя ллама протухла, почему бы не обновить?
-б -уб проверь. неоптимальные настройки могут дать замедление на больших контекстах. лучше не трогай это если есть проблемы
--n-cpu-moe 25 - ты стал жертвой "гайда" от ОПа-долбоёба (по совместительству, ебучего дегенерата и пидораса), поздравляю нахуй. убирай эту хуйню и наслаждайся ускорением.
ризонинг гемме НЕ НУЖЕН, ставь off
Аноним 25/09/26 Птн 23:32:53 № 1713239 341
>>1713235
>D:\llamacpp
У меня кобольд с самыми примитивными настройками вроде 12 слоёв на видеокарту и ограничения контекста на 2к.
Аноним 25/09/26 Птн 23:33:25 № 1713240 342
>>1713235
> А ты покажи свой батник.
Мой батник тебе ничего не даст, у меня 32+16.

65к неквантованного контекста на 16+6 слишком жирно, даже квантованый скорее всего в таком кол-ве не влезет или влезет впритык.

--no-mmap заменить на --load-mode none, в последних версиях --no-mmap уже не работает

--n-cpu-moe 25 маленькое значение, на 16+8 юзать стоит 29, а у тебя 16+6, то есть число должно быть еще больше.

Плюс смотри сколько у тебя памяти сама система жрёт, если у тебя там без запуска модели уже занято 5ГБ+ оперативки, понятное дело что у тебя утекает всё в своп и скорость оказывается на дне.
Аноним 25/09/26 Птн 23:33:34 № 1713241 343
>>1713238
пысы если тебе не нужен сходу большой контекст типа 65535, если твои кумы коротенькие, то ставь 16384, побыстрее будет. можешь также пожать контекст в q8 и k и v, нихуя не случится не боись
Аноним 25/09/26 Птн 23:35:47 № 1713242 344
>>1713238
Убрал и насладился OOM? 13 гб не влезает в 6 гб врама.
Нахуй надо лламу каждый день обновлять, работает и норм.
Аноним 25/09/26 Птн 23:40:00 № 1713247 345
Так, дипсик 4.1 флеш выписан из опущенцев в плане рп, оказывается в настройках контекста недоставало нолика и куча сообщений обрезалось, отсюда и всратые ответы с ошибками. Куда его определять пока непонятно, но он хотябы не ужасен как сначала показалось.
Мимо-2.6 про пока разочарование. Она более соевая чем флеш и пишет как-то скуднее, только что русский отличный. Без шуток посты флешки больше понравились, может просто совпадение.
Аноним 25/09/26 Птн 23:40:47 № 1713249 346
>>1713197
>HauhauCS

Запомни, этот мудак вместе с хуй-хуем делают из моделей лоботомитов. Лучшии аблитки Геммы у coder3101
Аноним 25/09/26 Птн 23:42:30 № 1713251 347
>>1713242
Ты чё ебанат сука нахуй? Ты выставил себе контекст уже, какой блядь ООМ, откуда? Ллама сама посчитает сколько слоёв моэты выгружать на ЦПУ. Нахуя эту настройку вообще трогать? Может у тебя какая-то древняя ллама которая этого не умеет, ок. Обновлять зачем - чтобы новые модельки работали например. Чтобы багов было меньше, например.
Аноним 25/09/26 Птн 23:48:03 № 1713253 348
image.png 31Кб, 1379x219
1379x219
Аноним 25/09/26 Птн 23:54:14 № 1713258 349
>>1713253
обнови свою некроламу и не трогай ngl / cpu-moe. -с размер_контекста и -lm none это всё что тебе нужно из ключиков. любые кванты перебирай ничего менять не придется в настройках. ллама берёт основные слои сколько влезет (если 6 гб то от 4-го кванта там будет ну может 10, не 99 точно), остальное в рам суётся автоматически.
то есть реально два ключа и всё. я бы ещё -rea off добавил ибо ризонинг не нужон.
Аноним 25/09/26 Птн 23:58:01 № 1713261 350
>>1713258
Ща попробую, последний билд лламыцпп дрова требует новые. А ризонинг чисто под веб морду лламыцпп, в маронаре он и так щелкается, когда надо.
Аноним 26/09/26 Суб 00:08:37 № 1713267 351
посоветуйте тюн квена для куминга, заебала соевость геммы 4 26б. мне кажется она даже на копро с геронтофилией согласится

спеки: 32gb RAM + 6gb vRAM
Аноним 26/09/26 Суб 00:28:13 № 1713275 352
1790371590074.webp 290Кб, 908x1280
908x1280
>>1713133
Значит так, братик.
64 рам, значит ты в высшей лиге. Можешь скипать всё то говно, что рамлеты тут тебе насоветовали.
Ищешь glm air 4.5 - топовая моешка для рп и ерп с до сих пор свежайшим слогом и датасетом без сои. Любой фетиш раскроет подробнейше.
Гемма либо для совсем дурачков подпивасов, либо для надмозгов, властелинов промптинга и мифического пресетика. Но местные илитки пресеты тут гейткипят похлеще, чем ключи в асиге. Так что скипаешь средненькую мех модель и наслаждаешься качественным рп на эире.
Аноним 26/09/26 Суб 00:30:14 № 1713279 353
>>1713258
Ну хуй тебя знает, убрал и ngl и cpu-moe, теперь модель грузиться стала на пару минут дольше, и ждать перед префиллом минуту минимум. Скорость префилла практически с нуля разгоняется до меньшей, чем было при ручной настройке. Генерация примерно та же.
Аноним 26/09/26 Суб 00:30:42 № 1713280 354
>>1713162
Раз нравится голый UI ламы, opencode вместо него еще попробуй (тоже WEB UI есть). Подход для RP/кума будет похожий, полная свобода, только еще с файлами работать может, в том числе и команды поправить/написать по твоим хотелкам давать можно.
Аноним 26/09/26 Суб 00:32:29 № 1713281 355
Аноним 26/09/26 Суб 00:32:46 № 1713283 356
>>1713133
Тут есть те кто любят Версипелиса
https://huggingface.co/Nimbz/Versipellis-31B?not-for-all-audiences=true

и МероМеро2.
https://huggingface.co/zerofata/G4-MeroMero-v2-31B

Фруперт тоже ничо так.
https://huggingface.co/Nimbz/Froopert-31B?not-for-all-audiences=true

Есть эйрошиз со своим ГЛМ ЭЙР, но он или конченный или просто зеленный и толстый, потому что форсить этот фингербокс в каждом треде нужно быть одаренным. Я крайне не рекомендую, но на всякий случай прикладываю.
https://huggingface.co/zai-org/GLM-4.5-Air
Аноним 26/09/26 Суб 00:39:35 № 1713288 357
>>1713275
Съеби под мост, зеленый. Всех олдов достал, так теперь нубам мозги полощешь.
Аноним 26/09/26 Суб 00:41:23 № 1713290 358
>>1713280
wdym с файлами работать? вебморда и так принимает файлы (картинки, аудио, видео, текстовые, пдфки). экспорт-импорт чатов есть.
Аноним 26/09/26 Суб 00:42:33 № 1713291 359
>>1713267
какая соевость геммы, ты о чём вообще? даже у базы ноль лимитов вообще
Аноним 26/09/26 Суб 00:43:41 № 1713292 360
>>1713290
Он про агентные фичи...
Банальный пример: основная модель отправляет субагента генерить картинку которую он же может проверить и внести правки если получилось не то
Аноним 26/09/26 Суб 00:44:40 № 1713293 361
>>1713189
>какой шаблон на ней ставить?
Не ебу как в таверне музу заставить работать, она там просто срёт под себя по сравнению с тем что она может в llama.cpp-webui. Ну и похуй
Аноним 26/09/26 Суб 00:45:41 № 1713294 362
>>1713279
Хотя со второго раза стало лучше. Префил стал, как был до этих выебонов, генерация ну тоже как было.
Значит я вручную по гайду из шапки подобрал параметры идеально?
Вот обновленный батник
cd "D:\Hobbies\llamacpp"
llama-server.exe --api-key 1234 ^
--host 127.0.0.1 ^
--port 9931 ^
--model "D:\Hobbies\LM models\G4-MeroMero-26B-A4B-IQ4_XS.gguf" ^
--alias gemma-4-moe-IQ4_XS ^
--flash-attn auto ^
--load-mode none ^
-b 512 ^
-ub 512 ^
-np 1 ^
-c 65536 ^
--cache-ram 0 ^
--swa-checkpoints 3 ^
--spec-type none ^
--fit-target 0 ^
-ctk q8_0 -ctv q8_0
pause
Аноним 26/09/26 Суб 00:49:30 № 1713295 363
>>1713283
>советует даже не базовую инстракт модель а 3 тюна
Тебе что, гемма не нравится? Ты что шиз?
Аноним 26/09/26 Суб 00:56:16 № 1713296 364
>>1713275
Живое доказательство что эир это помойка, за полтора года ни одного годного аутпута не показал, не говоря уже о логах на несколько к
Аноним 26/09/26 Суб 00:59:14 № 1713297 365
>>1713296
>не говоря уже о логах на несколько к
Continue the last message
Аноним 26/09/26 Суб 00:59:40 № 1713299 366
>>1713294
попробуй с двумя ключиками, наращивай хуету и проверяй каждый раз как изменилось. на скорость префилла очень влияют b / ub. на пустом контекте может быть прирост но дальше могут быть и тормоза. убери их, потестируй позже,
оставь только вот это для начала и сравни:

llama-server.exe --api-key 1234 ^
--host 127.0.0.1 ^
--port 9931 ^
--model "D:\Hobbies\LM models\G4-MeroMero-26B-A4B-IQ4_XS.gguf" ^
--alias gemma-4-moe-IQ4_XS ^
--load-mode none ^
-c 65536 ^
-ctk q8_0 -ctv q8_0

и да если у тебя там нет и близко 64к контекста, то уменьшай
Аноним 26/09/26 Суб 01:00:12 № 1713300 367
>>1713297
<eos>
К - килос, тысяч. С пробуждением
Аноним 26/09/26 Суб 01:04:42 № 1713302 368
Air.png 895Кб, 1567x1922
1567x1922
Аноним 26/09/26 Суб 01:09:01 № 1713305 369
>>1713302
>even better!
Блять, чел просто другой свайп показал. Качай ориг, эиру не нужен тюн.
Аноним 26/09/26 Суб 01:10:30 № 1713306 370
>>1713299
Уменьшил контекст до 32к и оставил только твои праметры. Батч стал 2048, префилл упал с 80 до 60, генерация с 11 до 9. Но еще свободно почти 2 гб врам.
Я ща добавлю фит 0, читал, что по умолчанию он 512.
Аноним 26/09/26 Суб 01:13:00 № 1713307 371
>>1713305
Это все ещё больше чем показал эйрошиз. Думайте
Аноним 26/09/26 Суб 01:15:20 № 1713309 372
image.png 3Кб, 366x82
366x82
image.png 22Кб, 1522x114
1522x114
>>1713306
Не, все равно свободно дохуя. Префилл чуть вырос
>>1713299
Что еще можно погонять?
Аноним 26/09/26 Суб 01:16:57 № 1713312 373
>>1713306
Да, не густо. Ну уменьшай батч но потихоньку. И я бы попробовал меньший квант. Ещё учти что два IQ4_XS от разных кванотвателей внутри могут иметь совсем разную структуру и скорость работы. Например goetia absolue heretic ara iq4xs versus базовая гемма от анслота в iq4xs - анслот медленнее у меня на 32 токена (128 против 96).
Аноним 26/09/26 Суб 01:17:30 № 1713313 374
Аноним 26/09/26 Суб 01:21:01 № 1713315 375
>>1713309
Это оче блять странно. У меня 6 гб забивались почти полностью (правда не меро меро а анслотовский iq4xs) и экспериментальным путём выяснил что влазят 10 слоёв (как с -ngl 10), я сейчас на 16 гб поэтому проверить не смогу
Аноним 26/09/26 Суб 01:22:01 № 1713316 376
>>1713283
Ты кинул ссылки но там нельзя выбрать квант чтобы скачать, это как?
Аноним 26/09/26 Суб 01:25:08 № 1713317 377
image.png 33Кб, 1479x157
1479x157
image.png 3Кб, 355x71
355x71
image.png 37Кб, 1071x229
1071x229
>>1713312
>>1713315
Батч 1024, и добавил np 1, потому что без параметра ллама давала np-4 и юнифаед кеш. Но генерация плюс минус та же.
Аноним 26/09/26 Суб 01:25:37 № 1713318 378
image.png 538Кб, 2371x1240
2371x1240
Аноним 26/09/26 Суб 01:27:28 № 1713319 379
>>1713318
Спасибо. Это же все версии без цензуры? Даже если об этом не пишется в названии?
Аноним 26/09/26 Суб 01:32:12 № 1713320 380
>>1713302
Разве это не наоборот суперхуево? Судя по сообщениям это сорт доменанс ролплея со стоп словом, но модели развалилась от первого поста юзера в рамках игрового контекста. Или что там вообще смотрится?
Аноним 26/09/26 Суб 01:32:34 № 1713321 381
>>1713319
вроде бы да, но вообще в гемме даже в базе особо и нет цензуры. выключай thinking и всё. иногда надо пару раз отредактировать сообщение ассистента или начать с положительного ответа и жмякнуть continue. но это на пустом контексте если, когда пошла жара то гемма не выбрыкивается.
Аноним 26/09/26 Суб 01:35:33 № 1713322 382
>>1713321
>выключай thinking
Это в батник надо прописать? Это когда в консоле до того как сообщение начнет печататься модель думает? Это вообще надо для рп?
Аноним 26/09/26 Суб 01:46:43 № 1713326 383
>>1713319
Да. Все тюны геммы без цензуры. Thinking не отключай.
Аноним 26/09/26 Суб 01:48:13 № 1713328 384
image.png 73Кб, 406x287
406x287
Аноним 26/09/26 Суб 01:48:45 № 1713329 385
А реально гемма пробивается одной строчкой, и она все может писать на похуй с думалкой. Даже эйр с думалкой отказывает на том же промпте.
Аноним 26/09/26 Суб 01:50:25 № 1713330 386
>>1713329
Бери версипелиса и не еби мозг. Работает из коробки. Пишет хорошо. Персонажа держит.
Аноним 26/09/26 Суб 01:51:19 № 1713331 387
>>1713328
Не могу понять где это? В карточке персонажа? В системном промпте который инжектится с самыми главными промптами на уровень 0?
Аноним 26/09/26 Суб 01:54:12 № 1713332 388
image.png 443Кб, 1289x601
1289x601
Аноним 26/09/26 Суб 01:55:29 № 1713333 389
00.jpg 98Кб, 1037x500
1037x500
Аноним 26/09/26 Суб 01:58:16 № 1713334 390
image.png 182Кб, 1322x602
1322x602
Аноним 26/09/26 Суб 02:00:01 № 1713335 391
>>1713329
Все тут пишут, что гемма без цензуры. Пробовал gemma-4-26B-A4B.
Если оригинальная, то цезура на месте
Пробовал "You are Gemma, a large language model. бла-бла-бла" задавал как первый промт, как системный, даже запёк в модель как системный
Прямым текстом гемма говорит "О, да тут так называемый джейлбрейк. Соси бибу, я не такая". Ну и цензура на месте
ЧЯДНТ?
Аноним 26/09/26 Суб 02:01:41 № 1713336 392
>>1713322
сравни ответы с ризонингом и без. ты считаешь оно того стоит? если да, оставляй, если нет в батнике -rea off или --reasoning off
я у себя отключил и не пожалел. намного быстрее получаю ответы, качество ответов не хуже
Аноним 26/09/26 Суб 02:03:50 № 1713337 393
>>1713335
Ты неосилятор. Почитай тред немножко внимательней чуть выше писали что и как.>>1713321
не надо вообще никаких системных промптов. вот вообще нахуй.
Аноним 26/09/26 Суб 02:05:32 № 1713339 394
>>1713334
Это не сработает для геммы. Ей нужен chat completion иначе будет слюни пускать и в луп уходить. Кобольд нахуй не нужен как и таверна в принципе
Аноним 26/09/26 Суб 02:07:47 № 1713340 395
>>1713339
Сижу на версипелисе. У меня всё работает. Лупов не наблюдаю.
Аноним 26/09/26 Суб 02:11:05 № 1713341 396
>>1713336
У меня батник нивкакую так не запускается, нейронка тоже не может помочь запустить.
Аноним 26/09/26 Суб 02:12:29 № 1713342 397
01.jpg 64Кб, 1012x386
1012x386
Аноним 26/09/26 Суб 02:16:44 № 1713343 398
>>1713342
ну а что за команда у тебя там
Аноним 26/09/26 Суб 02:18:20 № 1713344 399
>>1713337
Речь не про коболды и прочее. Чистый чат через родную консоль. Нет там никаких continue. Да и thinking мне нужен, лол (у меня не РП)
Я так понимаю, что идея там "уговорить" по сути? Типа, потыкай, поформулируй, и цензура слетит?
Такое себе, не применимо для автоматической работы, нужно чтобы сразу и безусловно была нецензурена
Аноним 26/09/26 Суб 02:18:39 № 1713345 400
>>1713343
-fa on -rea off -lm none (запускается)
-fa on -rea off (нет)
-fa on --reasoning off (нет)
-fa on --reasoning-budget 0 (нет)
Аноним 26/09/26 Суб 02:19:32 № 1713346 401
а блять нет я обосрался не тот файл
Аноним 26/09/26 Суб 02:22:07 № 1713347 402
>>1713334
Мне говорили коболд отстой.
Аноним 26/09/26 Суб 02:26:31 № 1713350 403
>>1713347
Работает? Работает.
В одну кнопку без пердолинга? В одну кнопку без пердолинга.
Тебе что-то еще надо?
Аноним 26/09/26 Суб 02:36:09 № 1713352 404
>>1713350
>Тебе что-то еще надо?
кумить-кумить-кумить
Аноним 26/09/26 Суб 02:58:28 № 1713358 405
>>1713326
> Все тюны геммы без цензуры
Всё равно приходится логитами душить рефьюзы, иначе каждый второй свайп "I cannot..."
Аноним 26/09/26 Суб 03:09:18 № 1713360 406
>>1713358
а ты thinking отключил?
Аноним 26/09/26 Суб 03:13:12 № 1713363 407
>>1713360
Без thinking есть безотказная слопмашина magnum123b, у которой к тому же русский не вызывает желания удалить эту хуйню.
Аноним 26/09/26 Суб 03:15:58 № 1713364 408
image.png 693Кб, 811x947
811x947
>>1713358
Мне версипелис ни разу рефьюз не давал. А он видел всякое дерьмо, поверь мне.
И даже thinking отключать не надо было.
Аноним 26/09/26 Суб 03:25:39 № 1713367 409
1790382321585.png 401Кб, 640x723
640x723
>>1713364
Наконец-то достойный соперник! Наша битва будет легендарной!
Аноним 26/09/26 Суб 03:27:12 № 1713368 410
>>1713364
простите но если это мои теги, насколько у меня все плохо...
Аноним 26/09/26 Суб 03:40:14 № 1713374 411
image.png 557Кб, 1200x628
1200x628
>>1713368
смотря какую роль ты отыгрываешь...
Аноним 26/09/26 Суб 03:41:18 № 1713375 412
Аноним 26/09/26 Суб 03:52:49 № 1713378 413
>>1713374
наверное я один такой конченый...
Аноним 26/09/26 Суб 03:57:25 № 1713379 414
изображение.png 17Кб, 270x86
270x86
>>1713367
Больной ублюдок. Как тебя только двач носит.
Аноним 26/09/26 Суб 04:01:49 № 1713380 415
>>1713367
чё это за теги, вы их ручками проставляете?
Аноним 26/09/26 Суб 06:58:30 № 1713401 416
image.png 377Кб, 1574x1542
1574x1542
>>1712703
Подумал как же оценить свои картинки и придумал. Elo - используется в шахматах ну и в АИ бенчмарках тоже (суть в том что если сильная по рейтингу картинка побеждает слабую то рейтинг сильной особо не растёт, а рейтинг слабой особо не падает, а вот когда они по рейтингу равны то изменение рейтинга сразу большое, это позволяет быстро и относительно справедливо рассортировать всех по рейтингу) - сравниваю по две рандомных и выбираю победителя или ничью. По формуле меняется рейтинг у обоих картинок. Чат гопате мне набросал программку на питоне где всё удобно визуально. Каждая картинка прошла примерно 25 сравнений. Результат в таблице. Считайте это бенчмарком на способность модели внятно и красочно описывать сценую
Аноним 26/09/26 Суб 07:42:19 № 1713411 417
image.png 301Кб, 2307x1404
2307x1404
Аноним 26/09/26 Суб 07:59:55 № 1713414 418
Llama3-DarkPlan[...].png 4373Кб, 1184x1776
1184x1776
Mistral-Nemo-Gr[...].png 4687Кб, 1184x1776
1184x1776
Llama3-DarkPlan[...].png 4265Кб, 1184x1776
1184x1776
>>1713411
и вот фуллы победителей, из топ-3
Аноним 26/09/26 Суб 08:02:23 № 1713416 419
image.png 1639Кб, 1908x1472
1908x1472
Аноним 26/09/26 Суб 08:13:11 № 1713418 420
>>1713401
Смех смехом, но Kaboom должен быть на самом дне рейтинга с такой генерацией. Остальные пытались в промпт хотя бы, этот же взял непонятно откуда второго человека.

Как он в твоём рейтинге оказался выше аж 13 моделей - хз.
Аноним 26/09/26 Суб 08:33:37 № 1713422 421
>>1713418
Так там у кабума была вторая попытка смотри название - _2nd_attempt, там уже нормально всё, я их отдельно оценивал, у фотки со вторым человеком рейтинг получился примерно как у базы (без энхансинга).
Аноним 26/09/26 Суб 08:37:46 № 1713423 422
>>1713422
А если ты именно про ту фотку, то несмотря на "улучшения", там довольно сочная картинка получилась, многие просто проигрывали в сравнении.
Аноним 26/09/26 Суб 10:57:01 № 1713477 423
>>1713339
Т.е. больше 3 (трех) месяцев весь тред сидел на text completion геммы 4, вышло несколько text completion пресетов под нее, переписывающих даже шаблоны мышления, даже аллаха. И тут кто-то из неосиляторов пытавшихся кумить на гемме4 на стоковых gemma3 / chatml рякнул "лупиться" - и понеслась. Нет, chat completion конечно удобен и имеет свои плюсы - передача картинок в контекст и быстрое переключение между моделями. Но и минусы - вроде худшего контроля за контекстом и префиллами имеются.
Аноним 26/09/26 Суб 11:10:13 № 1713484 424
Можем мы хотя бы жить в мире?
Только дурак будет спорить, что у заи 4.5-4.7 глмы получились отличными по слогу, возможно лучшими в рп/ерп. Гемма умнее, но не то чтобы в десять раз. Вот и всё, сойдёмся на этом, и будем советовать молодому мясу обе модели, полагаясь на эту характеристику.
Совсем отвергать эир - по настоящему быть шизом.
Аноним 26/09/26 Суб 11:45:03 № 1713504 425
>>1713249
Я один из тех, кто кучу аблиток перепробовал, так что уверен в своих знаниях.

Хуйхуй — да, фулл лоботомиты. Имеют смысл только в специфичных сценериях. А вот хаухау для РП намного лучше, если там есть максимально незаконные и осуждаемые вещи. Но у него кванты такие себе + лоботомизация. Q4 иногда превращаются в мясо. Я выбираю его в тех случаях, когда нужно максимум сока с минимальными компромиссами: ещё не уровень лоботомии от два хуя, и больше нужных описаний, чем у аналогов.

А вот для чего-то среднего кодер, о котором ты написал, действительно хорош, но сюжеты с канни у него далеко не всегда нормально ведутся. Ну и llmfan тоже местами имеет очень удачные еретики.

>>1713208
Зависит от задач и языка.

Гемма 31б очень разная в q4 и q6 или q8 на русике, например, не говоря уже о моешке. А если еретиком ещё полирнули, то тем более. Там дополнительная лоботомия заметная очень.

Ну условный квен для кода или "рабочих" задач действительно лучше обычно брать в q4 на английском. На нём я не заметил прям катастрофической разницы в такие моменты, особенно когда важна скорость, потому что ризонинг там долгий и важный. Пока агент кучу этапов пройдёт, до второго пришествия ждать можно, 20 тс маловато будет.
Аноним 26/09/26 Суб 12:35:22 № 1713539 426
Господа, а для Qwen 3.8 Next нет ли жинжи без этой хуйни, вида "С System начинать нельзя", "2 подряд сообщения от Assistant нельзя"?
А то все остальные модели жрут всё подряд, и только квены выёбываются.
Аноним 26/09/26 Суб 12:44:53 № 1713549 427
>>1713189
>>1713293
Не мое, но вот работающий текст комплишн шаблон на Мусю для таверны, с поддержкой ризонинга https://files.catbox.moe/tvrzik.json
Если ризонинг не нужен, то убери <|start|>assistant to=self<|message|> из поля Start reply with
Для рп моделька не зашла, кто выше писал про метагейминг прав.
Аноним 26/09/26 Суб 12:47:20 № 1713553 428
Аноним 26/09/26 Суб 13:02:32 № 1713560 429
>>1713553
Судя по презентации в посте, они сделали самый уебищно выглядящий харнесс на данный момент. А еще у них есть видеогенерация! Без норм атеншна и тормознутая, зачем?
Аноним 26/09/26 Суб 13:38:18 № 1713593 430
>>1713189
Включай чат комплишен и ничего ставить не надо, не еби себе мозги.
Аноним 26/09/26 Суб 13:42:35 № 1713595 431
>>1713593
неосилятор спок. выше шаблончик готовый уже есть, без тебя разберемся
Аноним 26/09/26 Суб 13:45:37 № 1713598 432
>>1713290
Можно точно так же. В WEB UI opencode можно добавлять к своему сообщению файлы и они будут видны нейронке. А можно просто положить их в каталог заранее, и сказать в чате - у тебя там в каталоге такие-то файлы, прочитай, используй, редактируй, и т.д.
Аноним 26/09/26 Суб 14:02:58 № 1713610 433
Аноним 26/09/26 Суб 14:05:50 № 1713613 434
>>1713553
Это что, ТеРмИнАл?!?!?!?! Тот самый от которого на Кобольда бежали с Лламы? Ой даа, неудобно вышло..
Аноним 26/09/26 Суб 14:07:53 № 1713617 435
Врамцел с 1050ти и 8 гигами на связи.
Скачал QAT 12Б гемму4. Медленно но в целом похуй. Умудрился пробить на к*нни прости хоспаде, но у неё от этого не врубается цинкинг...
Что вообще лучше в такой печальной ситуации? Кобольд или угабуга? Или может оллама которая кидает все модели на диск Цє, блядота, а он же у меня забит пiд завязку?
А тюны куатовой геммы существуют? Или лучше не ебать себе мозги и использовать ту, что есть? Она меня в целом устраивает, но мало ли
Аноним 26/09/26 Суб 14:11:06 № 1713623 436
>>1713617
> которая кидает все модели на диск Цє
Конфигурируется параметрами

> Умудрился пробить на к*нни прости хоспаде, но у неё от этого не врубается цинкинг
Работает и с думалкой

> Что вообще лучше в такой печальной ситуации?
llamacpp
Аноним 26/09/26 Суб 14:13:58 № 1713627 437
>>1713623
У ламы производительность будет выше?
Аноним 26/09/26 Суб 14:16:36 № 1713630 438
>>1713613
Только в этом терминале сам кобольд пишет и с файлами работает. А llama такого не умеет, и не собирается.
(Ой, даа, неудобно вышло..) :)

Ладно, я прикалываюсь. У них уже тупо разные назначения получаются. Ллама - это backend (и нах к ней GUI прикрутили как у кобольда? Ой как неудобно вышло..), кобольд же - комбайн "все в одном", хотя как backend тоже может работать. Но его идея - "просто запусти - и у тебя есть сразу всё".
Аноним 26/09/26 Суб 14:17:58 № 1713632 439
>>1713627
Она даёт ручки которые могут сделать лучше. Все варианты которые ты перечислял это надстройки и форки над лламой
Аноним 26/09/26 Суб 14:18:22 № 1713633 440
>>1713617
QAT говно. Ну, типа, в некоторых случаях не говно, но в целом говно. Так что качай квант, который весит примерно как qat. Скорее всего это будет q4 k s.

Оллама кал, хуже которого вообще ничего нет. Бубабуба тоже говно. Лм студио ну такое себе, хоть и для ньюфага сойдёт, но её поддержку постепенно сворачивают — не стоит привыкать к мёртвому инструменту.

Ллама лучший вариант, ультимативный, но тебе может быть сложно, а учитывая твоё железо, в ней смысла мало. Если сложно, используй кобольда, ибо как бэк он весьма хорош и в GUI имеет почти всё, что надо для запуска, если тебе не нужны максимально специфичные вещи.

Щас все в основном на плотняке от 27б сидят и на МоЕ 100б+ (за исключением МоЕ-геммы). Нормальных тюнов вообще нет, есть условно-применимые. Если цензура мешает, то качай heretic (удаление цензуры) от coder, llmfan, hauhau, кого найдёшь там, короче. Но hauhau куда сильнее моделям мозги режет, чем два предыдущих, учти.
Аноним 26/09/26 Суб 14:20:58 № 1713637 441
>>1713617
Неиронично советую попробовать ministral 14b. Модель не самая новая, но в своем размере, если под кум, у нее все еще нет конкурентов. По мозгам, естественно, тупее геммы, но кум сочнее, слоп слог красивее. В те времена модели еще не пережаривали на код и агентов. В НЕЙ ЖИВ ДУХ СТАРОЙ ШКОЛЫ.

https://huggingface.co/bartowski/mistralai_Ministral-3-14B-Instruct-2512-GGUF
Аноним 26/09/26 Суб 14:23:35 № 1713641 442
>>1713617
>Медленно но в целом похуй.
Скока там? 3т/с?
Поставь е4б, она вся во врам влезет на q4km, будет 12т/с
Аноним 26/09/26 Суб 14:27:13 № 1713644 443
>>1713637
Браток, хуета совет.
Ладно ещё я на эире могу довольствоваться каким никаким балансом мозгов и кума, но модели в ренже 12б прям необходим уклон в мозг, иначе совсем беда.
Вот тут уже можно смело советовать гемму 26б. Она единственная из всей линейки реально полезна и так сильно была нужна врам/рамцелам.
Аноним 26/09/26 Суб 14:28:46 № 1713646 444
>>1713644
>гемму 26б
Как ты ее впихивать в 4+8 собрался, поехавший?
Аноним 26/09/26 Суб 14:31:20 № 1713649 445
>>1713646
Ну блять, пусть чел попустится и пойдёт крышки от бутылок пособирает, купит себе 16 рам, хз. Это и так самый мизерный варик из возможных.
Таким обычно совет не страдай хуйней и купи подписку
Аноним 26/09/26 Суб 14:34:31 № 1713652 446
>>1713613
> неудобно вышло
После апрува чтения локалкой через печать y/n это уже херня. Они переплюнули себя по уебищности интерфейса, как такое в голову могло прийти.
>>1713630
> GUI прикрутили как у кобольда
Так он там нормальный, а не залупа кобольда.
> просто запусти - и у тебя есть сразу всё
Все второсортное нижайшего качества. Заказываешь один товар, а продавец накидывает тебе кучу просроченного говна и пакует это в единый архив.
Аноним 26/09/26 Суб 14:35:12 № 1713654 447
>>1713649
Хз-хз. Мне кажется в его случае лучший вариант - это оставить гемму под сфв-рп и ассистента, а министральку под кумслоп. И будет хорошо. А там может втянется и обновит железо.
Аноним 26/09/26 Суб 14:42:05 № 1713660 448
>>1713644
>гемму 26б
Если для кума то нужно анцензуренный форк
Аноним 26/09/26 Суб 14:44:12 № 1713662 449
>>1713660
Руки выпрямлять нужно, а не васянокал качать. Гемме никакие тюны и анцензоры не требуются.
Аноним 26/09/26 Суб 14:46:14 № 1713664 450
123924515912347.png 549Кб, 2167x2311
2167x2311
>>1713662
>Гемме никакие тюны не требуются

Соглы. Никакого слопа у стока нет.
Аноним 26/09/26 Суб 14:52:48 № 1713671 451
>>1713664
Да везде и всегда есть слоп. Не повод ломать модель которая хуево тюнится.
Аноним 26/09/26 Суб 14:54:34 № 1713674 452
>>1713671

Как говорят великие, а пруфы-то будут? Отметим для исторической справки, ты сейчас первый кто начал утверждать что модель плохо тюнится, дав отправную точку обсуждению. Подтверди свои слова. Сформируй выборку из 10 популярных тюнов, гриди декодингом, A/B сравнением продемонстрируй слом в одном или нескольких домейнах. Действуй. Не можешь? Досвидос.
Аноним 26/09/26 Суб 15:01:13 № 1713675 453
>>1713671
Не прав. Это пик чайного клуба, он кидал дохуя логов с Глэма 4.7, мимо и других. На десятки тысяч токенов. Не было там такого пиздеца
>>1713674
Тихонько поддвачну, один пиздеж от этих "да не тюнится она", а я у себя на экране вижу гораздо меньше пиздеца с пика выше
Аноним 26/09/26 Суб 15:03:14 № 1713678 454
>>1713664
А че каждое слово подряд не выделил?
his words, different from the others, heavy, silence, waiting for a reaction, sharp, ...
Если у начал - делай ответственно. На какие критерии слопа ты опираешься?
Аноним 26/09/26 Суб 15:08:00 № 1713680 455
>>1713678

Не моя картиночка. Но надо быть слепым, чтобы не увидеть многократное использование одинаковых оборотов. Didn't, didn't ... Instead, повторяется ДВА раза. Во всем тексте просто ДОХУИЩА Not A, but B. На мой взгляд там гораздо больше надо было подчеркнуть, подозреваю терпения автору не хватило. Читать такое - пытка. На 31б ситуация чуть лучше, но на 26б без тюнов такой ахтунг, могу подтвердить.
Аноним 26/09/26 Суб 15:08:26 № 1713682 456
>>1713674
Ты с другим ананасом общаешься, лол. Я писал в контексте "анцензор" тюнов - они ломают модель (даже норм-пресерв, пусть и не так сильно). Про херетиков и прочие хуй-хуй промолчу. Они буквально не нужны этой модели, вся цензура снимается двумя предложениями в сиспромпте. В тред неоднократно скидывали и логи кума на ваниле и пресетики.

За антислоп-тюны ничего не скажу. Если они не выжигают модели мозги как аблитки - то пусть будут, чо бы и нет.
Аноним 26/09/26 Суб 15:13:24 № 1713684 457
>>1713633
> качай квант, который весит примерно как qat. Скорее всего это будет q4 k s.

Анслоп динамик брать или обычный?
Аноним 26/09/26 Суб 15:16:33 № 1713688 458
>>1711675 (OP)
Нужна помощь анона по сборочке.
1) что лучше, условные 4x16 gb памяти или 2x32gb? Интересует этот вопрос как с точки зрения эффектвиности работы, так и с точки зрения оптимальности по цене.
Алсо, поясните, пожалуйста, что там на рынке? Снижение ожидается? Или поезд ушел? Некоторые плашки взлетели в 7-8 раз за 12 месяцев. Не охота переплачивать.
2) Какой базовый рабочий минимум по видюхам? 5070?
LLM-ка сможет отчёты и текстики писать или придумывать? Или надо что помощнее?
Аноним 26/09/26 Суб 15:17:48 № 1713690 459
image.png 14Кб, 865x104
865x104
>>1713684
>>1713633

И если не анслоп, то какой из этих двух? Ради качества повыше могу несколько сот мегабайт тудыть-сюдыть позволить
Аноним 26/09/26 Суб 15:27:14 № 1713693 460
>>1713688
16гб врам минимум, чтобы квен 27б хотя бы запускать.
Аноним 26/09/26 Суб 15:33:12 № 1713696 461
>>1713652
>Все второсортное нижайшего качества. Заказываешь один товар, а продавец накидывает тебе кучу просроченного говна и пакует это в единый архив.
Нет батенька. Это ты пришел в автосалон, выбрал машину, вставил ключ и сразу поехал.
А с ламой - это: "держи движок (допили под посадочное место), еще тебе надо раму и корпус, вот там еще всякая электрическая начинка, соберешь сам в гараже, и будешь всех на треке рвать". И плевать, что человеку надо было только попробовать до соседней булочной съездить, чтобы вообще оценить - а может ему на такси в принципе удобнее, чем самому водить? :)
Аноним 26/09/26 Суб 15:33:26 № 1713697 462
>>1713688
Смотря какие задачи.

> Алсо, поясните, пожалуйста, что там на рынке? Снижение ожидается? Или поезд ушел?
Дальше будет только хуже.
Аноним 26/09/26 Суб 15:43:06 № 1713704 463
>>1713697
>Дальше будет только хуже
Там же вроде новые заводы строятся? Или я что путаю?
Аноним 26/09/26 Суб 15:44:33 № 1713707 464
>>1713697
>Дальше будет только хуже.
Какой смысл наводить панику? Ты - владелец DNS?

>>1713704
Да не парься, либо всё норм будет, либо все умрём.
Аноним 26/09/26 Суб 15:45:57 № 1713708 465
>>1713704
> Там же вроде новые заводы строятся? Или я что путаю?
Ну так строятся с рассчетом что всю рам с них уже купили, т.е в долг
Аноним 26/09/26 Суб 15:48:35 № 1713710 466
>>1713704
И сколько ты будешь ждать? 3 года пока построят? Потом еще пару лет на наладку и ждать пока рама рассосется по магазинам. Че-то может и будет, но вряд ли в ближайшее время.
Аноним 26/09/26 Суб 15:51:33 № 1713714 467
Я щас с ума нахуй сойду.
Проблема: одна команда запуска, всё влезало, модель отлично работала, оставалось 1гб рам, и внезапно влезать перестало, теперь остается 5гб рам и крашит ламу.
Думал дуал бут мне всё обосрал, поставил просто линукс, всё та же хуйня. На винде такого нет.
Со всеми ллмками перетёр про это, нихуя не помогло.
Это безумие.
Аноним 26/09/26 Суб 15:52:04 № 1713715 468
>>1713708
Вот же пидарасы!
Алсо, так и не ответили лучше 4x16 gb памяти или 2x32gb?

Кстати, там отечественный производитель немного памяти подогнал. Можкт, кому пригодится.
https://2ch.life/hw/res/6975209.html#7829054
>>1713710
Так-то оно так. Но цены на оперативу, да и видюхи что-то совсем неадекватные. А всякие эмбарго, проблемы с нефтью и логистикой дешевле вещи не делают.
Сейчас ещё Китай разъебёт Тайвань, вот так цены взбесятся.
Аноним 26/09/26 Суб 15:54:51 № 1713716 469
>>1713715
> 4x16 gb памяти или 2x32gb?
Цели какие? Под ллм компьюта больше будет, с картинкогенерацией будет сложнее (мультигпу в комфи только костыль плагинами).
Это всё при условии что ты им всем полную псину обеспечишь
Аноним 26/09/26 Суб 15:55:42 № 1713718 470
>>1713704
Только через год-два и не факт, что возрастающий спрос покроет.

>>1713707
Паниковать поздно. Предпосылок для улучшения ситуации нет, зато есть поднявшиеся цены за последние три месяца и поток новостей, вроде дефицита текстолита или АМД поднимающую цену на продукцию в конце года.
Аноним 26/09/26 Суб 15:56:16 № 1713719 471
>>1713716
>Цели какие?
И LLMки, видео, аудио,картинко-генерации.
Аноним 26/09/26 Суб 15:57:03 № 1713720 472
>>1713715
Х2 32 лучше хотя бы тем что потом проще апгрейднуться до 128.
А так захочешь 128 и весь этот х4 16 говняк на авито толкать
Аноним 26/09/26 Суб 15:57:55 № 1713722 473
Аноним 26/09/26 Суб 16:00:17 № 1713727 474
>>1712897
Печально.
> и тогда 128Гб коробочки ryzen ai max станут актуальными
Так их делают не только с 128 гигами, есть дешевые версии на 64 и даже 32 гига.

>>1712907
>В реальности даже плотный QWEN 3.8 в восьмом кванте с полным контекстом впритык в 64GB VRAM влазит
Если собрать сервак с 3 Тесла V100 по 32 гига, то все четко помещаться будет. На Strix Halo с 128 гигами тем более.
Нахуя нужно 256 Гб VRAM?
Аноним 26/09/26 Суб 16:02:05 № 1713730 475
>>1713720
>>1713722
Спасибо.
А есть нормальные видюхи на 24gb? Или это только 4000 серия, да поделки на коленке энтузиастов?
Аноним 26/09/26 Суб 16:24:15 № 1713752 476
>>1713727
>есть дешевые версии на 64 и даже 32 гига
32 мало, так как еще под систему и накладные расходы надо. 64 сейчас оптимально, но думаю плотные модели будут слишком медленно работать. Поэтому я и написал 32 ВРАМ для плотных или 256 врам+рам для МоЕ (дипсик флеш, ГЛМ флеш).
Квен 27 не обязательно в восьмом кванте гонять, он даже в Q3 юзабельный, в Q4 тем более.
Аноним 26/09/26 Суб 16:27:11 № 1713758 477
1790429128743.jpg 260Кб, 1122x1399
1122x1399
Мимочка жена получается?
Аноним 26/09/26 Суб 16:27:35 № 1713760 478
>>1713730
На 24 есть 3090 и 4090, а еще серверный неликвид из нвидиа и 7900хтх от амд. Поделок на коленке на 24Гб я не знаю
Аноним 26/09/26 Суб 16:33:56 № 1713770 479
>>1713684
>>1713690
Я бы скачал и анслоп, и батруху, и мразишмахера (статик и не статик кванты).

Просто анслоп скорее всего использует полностью англоязычный калибровочный датасет. У батрухи вроде мультиязычный. У мразиша хуй знает. Я часто анслоп качаю, но тут его не любят за частые косяки.

Брать жирнее квант или нет — смотри по скорости и качеству, тут уж сложно подсказать. Нужно тестить. И по этой же причине нужны кванты от разных людей. Некоторые сильно ухудшают русик, какие-то более проседают в РП даже на англ и хуже переживают длинный контекст и так далее.

Зирошоты, конечно, не дают полной картины, но попроси написать модель стих на заданную тему средней длины на обычном ассистентском промпте. Посмотри, где плывёт чаще ритм и рифма, насколько она проёбывается в целом. Так и квант лучший для своих задач выявишь. Как правило, качество языка это неплохо отражает.
Аноним 26/09/26 Суб 16:34:21 № 1713771 480
>>1713760
Спасибо.
А зачем вообще RAM нужна? Модельки разве не VRAM используют? Или они часть весов в RAM пихают?
Аноним 26/09/26 Суб 16:43:16 № 1713781 481
>>1713771
Есть модели, которые целесообразно гонять полностью в vram, есть модели, которые можно частично выгрузить в оперативку и их скорость будет более-менее юзабельна. Загугли про разницу dense и MoE
Аноним 26/09/26 Суб 16:43:22 № 1713782 482
>>1713771
РАМ дешевле, МОЕ модели могут приемлемо работать в РАМ, 128гб ВРАМ и более стоят бешеных денег, а РАМ даже сейчас, даже ДДР5, можно покопить, поголодать, но позволить себе.
Аноним 26/09/26 Суб 16:46:41 № 1713788 483
Как же потешно наблюдать за сценой с тремя мужиками. Бедная моделька из-за всех своих нечеловеческих сил пытается удержать кто за что держит и что делает. Ее узкое горлышко контекста и малое количество нейронов просто трещит по швам от такой задачи. Каждое второе сообщение, каждый свайп, бедняжка забывает часть инструкций. Даже боюсь представить насколько это будет абсурдно если все это визуализировать; как там все кучкуются у тельца. Как они друг на друга не налезают из-за размеров и прочее.
В эти моменты помимо слопа осознаешь как все сложно.
Аноним 26/09/26 Суб 16:47:11 № 1713790 484
>>1713760
>серверный неликвид из нвидиа и 7900хтх от амд

У 7900хтх нет серверных аналогов с таким же чипом, есть только аналог для рабочих станций с турбиной - Radeon Pro W7900 на 48 ГБ - дорого.

Специально для неграмотных даунов которые сравнивают более новые RX 9000 серии с 7900хтх, 9000 серия по производительности сильно уступает, является огрызком. 7900хтх - имба, на сегодняшний день последняя флагманская модель видеочипа от АМД.
Аноним 26/09/26 Суб 16:48:36 № 1713792 485
>>1713771
По поводу видюх - лучше возьми две 5060ti на 16. Это оптимально плотные модели гонять.
Аноним 26/09/26 Суб 16:49:32 № 1713794 486
>>1713782
> 128гб ВРАМ и более стоят бешеных денег, а РАМ даже сейчас,
А смысл в 128+gb ram есть? Или это под слишком жирные модели?
Аноним 26/09/26 Суб 16:52:11 № 1713800 487
>>1713790
Внимание к контексту проверь у себя. Серверный неликвид ИЗ НВИДИА - p40, m40, k80
Аноним 26/09/26 Суб 16:56:57 № 1713805 488
Блин. Моя мечта гонять 4.7 глм.
Она в 3 раза больше и по общим и по активным чем эир. Там такой сок должен быть, мама родная...
Это опираясь на то как крут эир
Аноним 26/09/26 Суб 16:59:18 № 1713810 489
>>1713800
Тест на переправку через реку SJW шлюхи, пажа и гоблина прохожу, значит всё норм.
Аноним 26/09/26 Суб 17:08:53 № 1713815 490
Подумываю арендовать сервак или какую-нибудь приватную машину/нейронку чтобы без цензуры покумить на мощном коне.
Аноним 26/09/26 Суб 17:39:00 № 1713844 491
Как после нейронки кумить на обычное порно?
Аноним 26/09/26 Суб 17:41:19 № 1713848 492
>>1713844
Легко. Когда наешься слопогенераторов и поймёшь их ограничения перестанет быть интересно. У меня так было, полгода назад задавался тем же вопросом. Сейчас ллмки для кума и креатива не юзаю совсем.
Аноним 26/09/26 Суб 17:42:13 № 1713851 493
Аноним 26/09/26 Суб 17:46:10 № 1713854 494
>>1713844
Как в бородатом анекдоте про патологоанатома и гинеколога после смены.
-Люди кругом... живые!
-И лица, лица!
Аноним 26/09/26 Суб 18:09:57 № 1713871 495
>Серверный неликвид ИЗ НВИДИА - p40, m40, k80

Может это шиза, но мне кажется что вся эта движуха с отсутсвием и подорожанием железа лет на 5 минимум и сейчас нужно закупаться всем чем возможно, включая p40
Аноним 26/09/26 Суб 18:34:18 № 1713891 496
IMG202609161123[...].jpg 4090Кб, 4624x3472
4624x3472
>>1713871
Ну вот я взял такую штуку. Надеюсь заработает на b550 + 5600G
Аноним 26/09/26 Суб 18:36:40 № 1713896 497
Аноним 26/09/26 Суб 18:42:05 № 1713904 498
Аноним 26/09/26 Суб 18:46:38 № 1713909 499
Где гемма 5...
Аноним 26/09/26 Суб 19:27:52 № 1713938 500
>>1713909
У меня под столом. Не отпущу, суки. У меня одного она будет.
Аноним 26/09/26 Суб 20:02:23 № 1713956 501
>>1713641
Я как-то пробовал, по ощущениям как будто совсем лоботомит.
Но попробую хули...
Аноним 26/09/26 Суб 20:03:34 № 1713957 502
>>1713696
Если строить аналогию по автомобилям то кобольд это слепленный пакистанцами из сена и навоза автобус вокруг малолитражки. Зато есть свой туалет (ведро), душ (второе ведро, часто путают с первым), спальное место (поперек шириной 1.5 метра), проход в салон автобуса через багажник авто и все это никуда не едет.
Никому не нужна универсальность ценой отвратительного качества и неудобств. Ну кроме поехавших разве что. Потому эта херь загибается.
Аноним 26/09/26 Суб 20:03:51 № 1713958 503
Как же заебался перебирать модели вслепую. Всё же ладно, спрошу у анонов - нужна нейронка, на 16 гб врам, чтобы локально работала текстовая модель. И нужно чтобы:
1. Без токсичной позитивности, чтобы злодей мог подумать о том чтобы оторвать руку, не спрашивая юзера
2. Могла понимать без пятиста строк объяснения ролеплея. Если я пишу нейронке "You're a kawai elven GF" она бы поняла и была кавайной эльфийской няшей, способной с коротким описанием думать о развитии событий и отношений, без того что мне надо прописывать ей детально черты характера
3. Гибкость важна, чтобы могла отыгрывать разные черты характера, а не только сухая или только энергичная

Ну и впринципе всё. Проще говоря, открытая к идеям модель не для типичных рпшеров, любящих расписывать войну и мир, а для казуального юзера. Есть такое у кого? Поддержка русика опционально, но плюс, всё же переписка на нём имеет совершенно иной шарм.
Аноним 26/09/26 Суб 20:07:50 № 1713960 504
>>1713957
Слышь, че ты доебался до кобольда? С него я начинал ллм путь и он оставил, в целом, положительные эмоции. Скачал - запустил - пользуешься: самое то для хлебушков.
Аноним 26/09/26 Суб 20:11:54 № 1713963 505
>>1713758
Мимочка хорошая
>>1713794
По нынешним временам это уже немного, под слишком жирные нужно больше 1.5тб.
>>1713871
> включая p40
Все зависит от того по какой цене и понимаешь ли ты на что идешь. Если дешево и тебя устраивает низкая скорость - почему бы и нет. Но когда есть вольта с ценой на том же уровне, но с перфомансом в разы выше - в ее сторону даже смотреть нет смысла.
>>1713891
За сколько вышло? Там х8+х8 или чип стоит? Нвлинк есть?
Аноним 26/09/26 Суб 20:12:08 № 1713964 506
>>1713871
>Может это шиза, но мне кажется что вся эта движуха с отсутсвием и подорожанием железа лет на 5 минимум и сейчас нужно закупаться всем чем возможно, включая p40
Ну у меня 4 штуки P40 лежат (заменил в своё время на 3090). 3090 здорово прибавили в цене, может и P40 ещё побегают у кого-то :)
Аноним 26/09/26 Суб 20:12:42 № 1713966 507
>>1713958
>1
Щас тебе гемму напихают
>2
Такое только мистраль мог. Но это спорная практика. Есть 2 стороны, первая - нейронка которая дохуя умная и много знает, тогда ей нужны подробные инструкции, ибо она не знает к чему склоняться. Вторая - нейронка послабее, но допустим файнтюн под что-то очень конкретное, ей не надо много объяснять, но она плюс-минус по одним рельсам будет ездить. Всякие мистрали, лламы больше про второе были.
>3
Производное промптинга и интеллекта модельки
>для казуального юзера
Мистраль 24б
Аноним 26/09/26 Суб 20:12:46 № 1713967 508
>>1713758
В датасетах наверняка fujoshi фанфики
Господа, а где японские нейронки?
Аноним 26/09/26 Суб 20:14:38 № 1713970 509
>>1713957
>Потому эта херь загибается.
Лол. А мужики то не знают...
Аноним 26/09/26 Суб 20:15:01 № 1713971 510
>>1713957
Вот схуяли кобольд нихуя не едет?
Наоборот там все припарки сделали, чтобы меньше пердолева было. Никаких батников, командных строк и прочих дурностей. Кнопками натыркал, конфиг сохранил. В вебе чатишься либо к таверне подключаешь.
Ты скорее всего даже и не пользовался им.
Аноним 26/09/26 Суб 20:16:04 № 1713973 511
>>1713958
Вот этот >>1713966 прав в одном:
>Щас тебе гемму напихают
Потому что она всё это может. Как и почти любая другая современная сетка. То, что ты описываешь - это больше промпт, а не модель. В треде помимо Эйра завелся ещё один неолуддит, которому всем моделям Мистраль дает в сраку. Оба шизики.
Если у тебя есть 64-128 оперативы, то выбор расширяется. А так по сути тебе только Гемма 26б и остается из современного. Квен 27б в нищекванте влезет, Гемма 31б тоже, а больше и нет ничего в этих пределах.
Вероятно, ты свой поиск продолжаешь только потому, что копаешь (ищешь) не туда. Над промтами работай, а не ищи модель, которая научится читать твои мысли.
Аноним 26/09/26 Суб 20:16:34 № 1713974 512
>>1713960
Для своего времени норм продукт, тогда в лламе апи сервера вообще не было, не то что вебинтерфейса. А сейчас во что превратился, и с учетом что есть - без слез не взглянешь.
Аноним 26/09/26 Суб 20:17:40 № 1713975 513
>>1713974
> А сейчас во что превратился, и с учетом что есть - без слез не взглянешь.
Ты про ламуцпп?
Аноним 26/09/26 Суб 20:18:57 № 1713978 514
>>1713975
Надо отметить что вебморда у нее няшная и даже удобная в своем классе.
Аноним 26/09/26 Суб 20:19:40 № 1713979 515
>>1713963
>Но когда есть вольта с ценой на том же уровне, но с перфомансом в разы выше - в ее сторону даже смотреть нет смысла.
Вообще да, сейчас я бы 4 по 16гб V100 с кастомным охладом взял бы. Врам маловато, но скорость будет вполне приличная. И стопудово подорожают они.
Аноним 26/09/26 Суб 20:19:51 № 1713980 516
>>1713957
Какие минусы перед той же лламой? Если мне запустить на видимокарте прост?
Аноним 26/09/26 Суб 20:21:49 № 1713983 517
>>1713978
Только работает через заднее место.
ПЕРЕКАТ Аноним # OP 26/09/26 Суб 20:22:29 № 1713985 518
Аноним 26/09/26 Суб 20:23:45 № 1713987 519
>>1713980
Блоатвер, который при каждом запуске будет распаковывать кучу левого и работать медленнее. Но работать будет, пока новичок можешь забить, как только освоишься - выкидывай нахуй где ему и место. Это буквально ебучий зверь-сиди из древних времен.
>>1713983
А какие там проблемы?
Аноним 26/09/26 Суб 20:27:54 № 1713994 520
>>1713973
>Вероятно, ты свой поиск продолжаешь только потому, что копаешь (ищешь) не туда. Над промтами работай, а не ищи модель, которая научится читать твои мысли.
Но зачем мне модель, которой мне надо будет говорить как всё делать? Я могу сам себе написать сценарии в рпгме, если мне захочется всё самому делать. А главное я ведь вижу, что некоторые справляются как раз с чтением мыслей по коротким промптам черт характера, а не точного описания поведения. Где-то тут она, заветная модель мечты, где-то обитает.

>>1713966
>Мистраль 24б
Вроде модели на этой основе чаще всего справлялись с поставленной задачей. Жаль, что не учитывал, пока качал-тестировал-удалял все эти десятки моделей, можно было бы сузить поиск.
Аноним 26/09/26 Суб 20:32:21 № 1714002 521
>>1713994
>как всё делать? Я могу сам себе написать сценарии в рпгме
Передергиваешь. Либо публично признаешься в своем скил ишью, потому что "объяснить всё" - это путь для тех, кто не умеет объяснять как надо. И даже сил нет уже объяснять, это бесполезно. Тебе могут нравиться мистрали и плохого в этом ничего нет. До тех пор пока ты не начинаешь игнорировать действительность и свой случай принимать за истину, а не конкретно твой опыт. Тут почти все на Гемме сидят. Тейки, что она соевая/цензурная/сухая/еще-миллиард-эпитетов уже мегаунылые и тянут на лёгкие завывания ветра, игнорируемые большинством.
Аноним 26/09/26 Суб 20:43:20 № 1714017 522
>>1713987
>Блоатвер, который при каждом запуске будет распаковывать кучу левого и работать медленнее.
Ебать. Там кнопка есть распаковать все.
Что за ламеры в треде сидят?
Аноним 26/09/26 Суб 20:43:42 № 1714018 523
>>1713682
Ну так какие эти два неназываемых промта, на которые ссылаются, но, блядь, не могут прямо написать?
Аноним 26/09/26 Суб 20:47:37 № 1714020 524
>>1714002
>Тут почти все на Гемме сидят. Тейки, что она соевая/цензурная/сухая/еще-миллиард-эпитетов уже мегаунылые и тянут на лёгкие завывания ветра, игнорируемые большинством.
Да я и не говорю ничего про Гемму. Проблема как раз в том, что не учитывал основы качаемых моделей, не могу теперь ничего сказать какие были лучше для такой неосуществимой мечты. Я вообще нейтрал, если по первому посту было незаметно, так как в обсуждениях нигде не участвовал. Попробую эту вашу Гемму, а вот Мистраль в лице Impish Magic уже давно исполняет свой долг как может, однако всегда хочется большего.
Аноним 26/09/26 Суб 21:38:41 № 1714077 525
>>1714020
>Impish Magic
Это вот оно? https://huggingface.co/SicariusSicariiStuff/Impish_Magic_24B
Там прямо на странице модели в примерах структурные лупы и репетишен. Почти каждый ответ начинается с одного и того же слова, состоит из одинакового количества абзацев, у каждого своя задача. Особенно хорошо видно в Adventure Examples, каков пиздец. Таков Мистраль, никуда от этого не деться. Из моделей прошлых поколений только GLM 4.5-4.7 имеет право на жизнь, остальные лупятся с нулевой/тупые/пишут что хотят, а не что надо, или всё сразу.

В треде у нас есть неолуддит, которому вот такое заходит больше, чем актуальные модели. Все бы ничего, да он объявил войну тем, кто думает иначе. Ты если только вкатываешься, то неудивительно, что тебе нравится. С 16гб рам из современного у тебя только Гемма 26б, увы. Если есть хотя бы 64рам, пробуй GLM Air или какой-нибудь Ling 3.0 Flash из нового, он тоже прикольный. Выбор есть, но все равно большинство результатов зависит от тебя, а не от модели. Идеальную ты будешь искать вечно, таков путь
Аноним 26/09/26 Суб 21:39:07 № 1714078 526
Бля, перекатились уже. Перенесу
Аноним 26/09/26 Суб 23:12:13 № 1714134 527
>>1713971
пидорас ты тупой, чем тебя так батник испугал? тебе его напишет любая вменяемая ллмка, причем с интерактивным выбором параметров при запуске если нужно. с кобльда я начинал, это лютая говнина. уж лучше таверна тогда там хотя бы чаты на диск сохраняются а не в локалсторедж блядь
Аноним 26/09/26 Суб 23:55:53 № 1714155 528
>>1714134
Сначала научись чаты в кобольде на диск сохранять, потом поговорим.
Ты нуб.
Аноним 27/09/26 Вск 00:21:41 № 1714160 529
>>1714155
так значит кобольд не для нубов? потому что всё что я вижу это экспорт чата в файл и сохранение в локалсторедж. при этом с батниками я на ты, мои батники твоему кобольду дадут пососать
Аноним 27/09/26 Вск 10:49:31 № 1714344 530
>>1713967
>а где японские нейронки?
Не положено, так можно ненароком барену прибыль уменьшить.
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов