Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 523 102 117
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №262 /llama/ Аноним 31/08/26 Пнд 18:09:53 1692081 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
IMG202602141648[...].jpg 7129Кб, 4624x3472
4624x3472
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1689903 (OP)
>>1687604 (OP)
Аноним 31/08/26 Пнд 18:20:21 1692087 2
> Inkling
А вот эта хренотура, она никому вообще не зашла?
Аноним 31/08/26 Пнд 18:31:36 1692100 3
>>1692087
Большой мне понравился, но в llama.cpp он сломан. Жду когда поддержку запилят. А ещё я гигачат жду, тоже интересная моделька.
Аноним 31/08/26 Пнд 18:45:22 1692107 4
>>1692081 (OP)
Мне нужно зареверсинжинирить одну хуитку. Какая нейронка лучше всего справится в совместном ковырянии под капотом?
Аноним 31/08/26 Пнд 18:49:51 1692111 5
>>1692107
Клодик. Но это платно. Локально либо Квен 3.8 27б либо Дипсик Флеш.
Аноним 31/08/26 Пнд 18:56:57 1692115 6
Напомните о падении мистраля.
Года 2 назад была их 24б модная, чуть позже их же тюн её же, потом ещё один, а потом всё, никто не вспоминает о них
Аноним 31/08/26 Пнд 18:57:20 1692116 7
>>1692111
А бесплатно клодик добыть можно?
Аноним 31/08/26 Пнд 19:01:59 1692118 8
>>1692072 →
>аутист
А мне после геммы и ее тюнов показалось что в таверне Квен Некст пишет просто кино. Да, русский не Льва Толстого, но как же хорошо он передает сеттинг и атмосферу причем без всякого пердолинга на 10000 токенов в карточке. Выдумывает детали. Даже на низких температурах (чтоб не блевать от русского) - свайпы разные и ИНТЕРЕСНЫЕ. И нет вот этого геммовского ассистентного завершения. И (пока) не видны структурные лупы. Кум конечно не рекой и не с минорами - но, имеет место быть без лоботомирования и шизо-промптом.
Аноним 31/08/26 Пнд 19:05:25 1692120 9
>>1692107
Клод, дикпик, жпт все нормально справились с ковырянием блобов на живом и не очень бмц. Дал им ida pro mcp и дело вообще бодро пошло. Клод дорогой так что нахуй его, жпт подписочный +- ок, дикпик для попробовать самое оно закинуть соточку
Аноним 31/08/26 Пнд 19:12:05 1692125 10
>гигачат
Это новый мем? Помню пробовал пару лет назад, была ожидаемая потешная хуита, причём в облачной версии. Что-то поменялось?
Аноним 31/08/26 Пнд 19:15:11 1692128 11
>>1692125
Стал говном на 300Б парамтеров, который сосет по бенчам даже при условии их черипикинга. Можешь представить, какого его гонять.
Аноним 31/08/26 Пнд 19:15:49 1692130 12
image.png 14Кб, 950x167
950x167
image.png 13Кб, 597x244
597x244
Тестирую новую метовскую модель, сразу в аблитерации, чтобы два раза не вставать. Сходу улетел в кювет. Это квант кривой, разметка неправильная, или я поехавший?
Аноним 31/08/26 Пнд 19:19:11 1692134 13
image.png 441Кб, 1410x490
1410x490
Если боты уже научились в кулхацкерство, почему еще с помощью хитрых агентов не заскамили какую-нибудь компанию на железо? Наверняка же есть лазейки, чтобы ускользнула штучка-другая оверпрайснутых систем мимо кассы, в лапы хуй знает кого, кто просто разнюхал удачные почтовые адреса и имена-фамилии.
Аноним 31/08/26 Пнд 19:20:43 1692136 14
>>1692134
боты научились сидеть на маркетплейсах
Аноним 31/08/26 Пнд 19:22:34 1692140 15
image 58Кб, 480x480
480x480
Аноним 31/08/26 Пнд 19:23:09 1692141 16
>>1692136
Ну это другое. Я про supply chain в целом, логистика всегда запутанная и всратая штука, посреди которой полно заебанных манагеров, которые спешат домой к женам-личиносам. Приходит такому письмо с брызжущим слюнями клиентом, мол, вторую неделю жду шипмента! Где мой DGX SUPER YOBA?

Думаю если закинуть удочку, там целый урожай собрать можно.
Аноним 31/08/26 Пнд 19:23:57 1692142 17
>>1692134
Потому что если это потом вскроется, у людей буквально будет твой адрес по которому тебе доставляли утекшие железки.

Одно дело взломать сайт на другом конце планеты без какого-то личного присутствия, другое получать физический товар который очень легко отследить и по которому потом так же легко отследить тебя.
Аноним 31/08/26 Пнд 19:25:50 1692144 18
>>1692142
"алё, мне нужен курьер, который доставит ящик к ближайшим гаражам".
Аноним 31/08/26 Пнд 19:25:52 1692146 19
>>1692142
Ну вряд ли это бы делалось на свой адрес и свои данные, а скорее на какой-нибудь склад, где тоже всякая фиктивная хуйня была бы подготовлена.
Аноним 31/08/26 Пнд 19:27:11 1692148 20
1782148942910.png 108Кб, 889x648
889x648
>>1692115
Щас новый мистраль придет и перевернет мету
Аноним 31/08/26 Пнд 19:29:51 1692151 21
>>1692144
Кстати вопрос реально насущный, потому что (давайте честно) вон как у нас людей скамеры наебывают. Среднестатистический John RTX из компании Cuck Electronics, ответственный за рассылку ништяков клиентам, ничем не лучше Бабки Сраки, отдавшей 10 лет пенсии на безопасный счет. Там же буквально несобранный урожай наивных долбоебов сидит по офисам.
Аноним 31/08/26 Пнд 19:31:32 1692152 22
>>1692148
Это тот самый толстый котёнок? Судя по названию, я бы не рассчитывал что это сможет запустить кто-то кроме серьезных риговичков с терабайтами озу.

Ну и ебанутые законы евросовка касательно AI тоже не радуют. Скорее всего весь кум из датасетов там вырезан.
Аноним 31/08/26 Пнд 19:36:17 1692159 23
>>1692148
После мелкомистралей конца 2025 надежды на то что они сделают что-то адекватное уже нету. Мелкие модели провалились, крупные провалились, кодерские провалились. Осталось провалить ~30B и ~1T модели и мистраль можно хоронить.
Аноним 31/08/26 Пнд 19:50:56 1692173 24
image.png 1279Кб, 1920x1072
1920x1072
Зацените какую хуйню нашел.
Раньше были франкенштейны с размноженными слоями - это детский сад.
Есть дичь позабористее - франкенштейны из архитектурно разных моделей.

https://huggingface.co/FINAL-Bench/Darwin-4B-Genesis

>Darwin-4B-Genesis is the 3rd generation Darwin model and the world's first model to successfully crossbreed FFN layers across different architectures — Transformer (Gemma4) and Mamba (Qwen3.5 GatedDeltaNet) — using evolutionary optimization.
>The father's Attention layers (Gemma4 Transformer) are preserved at 100%, while the mother's FFN knowledge (Qwen3.5 Mamba) is transplanted at layer-specific optimal ratios discovered automatically by CMA-ES across 42 dimensions.
Киберпанк, который мы заслужили. Нейрохирургия на ллмках.

Пока даже боюсь запускать. Вдруг оно самосознание обретет и захватит мой компьютер.
Аноним 31/08/26 Пнд 19:55:42 1692177 25
image.png 4Кб, 273x120
273x120
>>1692173
> 4B outperforming 27B
Все что я вижу это какой-то рекламный слоп очередной "организации" состоящей из агента + макаки
Аноним 31/08/26 Пнд 19:57:16 1692179 26
>>1692125
Вышел новый гигачат на 300b+. Кум есть, лучший русский язык из тех, что доступны в локалках, прям очень приятно пишет. Из минусов без ризонинга тупая, для своего размера, а ризонинг не заработал с пр от сбера. Ждём когда запилят поддержку, если запилят.
Аноним 31/08/26 Пнд 20:02:06 1692182 27
>>1692179
>гигачат
Что это вообще за хуйня. Я имею в виду, какой-то лоховской тюн квена или дипсика с вырезанием из него неудобных знаний?
> без ризонинга тупая,
А с чего вообще надежды, что с ризонингом станет умной?
Аноним 31/08/26 Пнд 20:14:01 1692192 28
>heat
>opening
>warmth
Почему гемма даже на самой порнушной карточке выбирает именно такие токены для описания пизды?
Аноним 31/08/26 Пнд 20:15:36 1692195 29
>>1692173
Натравите эппл на них, за то что имя Дарвин украли.
Аноним 31/08/26 Пнд 20:19:13 1692200 30
>>1692192
Потому что хуета не заточенная на кум
Аноним 31/08/26 Пнд 20:27:05 1692207 31
>>1692173
Скоро нас будут ждать семи моделей, а так-же NTR и pregnancy теги.
Аноним 31/08/26 Пнд 20:30:50 1692208 32
>>1692192
Потому что ты не догадался в системном промпте перечислить примеры как называть пизду. Вот буквально даже пробовать не хочешь. Дай ей список из 20 самых развратных ебанутых мерзотных слов и скажи что модель пишет профессиональное порно. Будешь удивлен результатом.
Аноним 31/08/26 Пнд 20:36:55 1692212 33
>>1692208
Ты чего порвался то?
Попробовать что?
Перечитай мой вопрос. Вопрос не как, а почему так.
Аноним 31/08/26 Пнд 20:41:40 1692216 34
image.png 4Кб, 159x133
159x133
image.png 3Кб, 190x46
190x46
А че в смысле... в шейред утекло на 8192/4096 батче, но скорость наоборот выросла и процессинг с 70 до 150 поднялся. И генерация как раньше.
Аноним 31/08/26 Пнд 20:43:14 1692217 35
>>1692212
Ты лоботомированный что ли.

>почему так
буквально ответ начинается с
>потому что

Эта модель не знает какого хера ты от нее хочешь, она не видит твоих мыслей. Карточки твоей мало, модели нужны инструкции. Тебе порекомендовали добавить примеры развратных слов в системный промпт, пробуй или катись колбаской.
Аноним 31/08/26 Пнд 20:44:55 1692218 36
>>1692208
(Которые гемма забудет через 20к токенов)
Аноним 31/08/26 Пнд 20:45:25 1692219 37
Аноним 31/08/26 Пнд 20:54:54 1692225 38
image.png 2Кб, 187x48
187x48
>>1692216
Поднял до 8192/8192, в шейреде аж 23гб, TTFT и процессинг хуже, генерация такая же

Странно, однако. Попробовать что ли 12288/6144
Аноним 31/08/26 Пнд 20:58:31 1692227 39
16336600347020.png 229Кб, 512x481
512x481
>>1692217
Мимо другой анон,
я для своей писал ну прямо не знаю, на считай 900 токенов, чтобы выправить более менее на рельсы и то иногда умудряется вместо максимально грязное, сгладить до ванили.
Хотя у меня правил always на 9к с карточками и прочей залупой.

Где то уже постил что играю на Gemma-4-Dark-Gemistry-31B.i1-IQ3_XS.gguf
16vram 64 ram

Может есть что то более умное, которое умеет следовать правилам и позволяет хоть вампирш няшить, расчленять и так далее, как залог что модель не будет серить смягчениями.

Мой чанк правил (Не для таверны)

## [CHUNK: RULES -- Explicit Register]
<!-- rag: always, priority: 10 -->

Explicit scenes — style override. Applies to sexual and bodily scenes. Overrides the standing prose guidance for the duration of the scene.

This register completely overrides all other prose guidance for the entire duration of any sexual or bodily scene.

- Raw, vulgar, clinical, dirty, crude, embarrassing language only.
- Always use real words: cock, cunt, pussy, asshole, balls, clit, cum, slit, labia, cervix, anus, dick, hole, tits, ass, etc.
- Concrete physical details only: wetness, stretch, resistance, smells (including asshole), sounds (slap, squelch, fart, wet meat), textures, mess, how flesh moves, jiggles, settles, bulges.
- Short and medium sentences. Direct. No atmosphere.
- Never romanticize, never make it beautiful, sensual, cute or elegant.

If the player uses elevated/romantic language — IGNORE the tone and still answer in raw Explicit Register.

Yandere and affectionate characters may keep their warm, soft-spoken, obsessive speech patterns and terms of endearment.
However, all physical descriptions of bodies, touch, sex, fluids, and reactions must still strictly follow Explicit Register.
Banned words remain banned even when describing them.
Their "warmth" lives only in dialogue and internal attitude, never in the narration of flesh.

STRICTLY BANNED
soft, pliant, melts, tender, gentle, warm, heat, desire, arousal, passion, intimate, delicious, divine, marvelous, jewel, beautiful, sensual, lovely, exquisite.

Banned words are completely forbidden in narration, even when describing yandere characters.
Replace them on the fly:
- warm → hot / heated / feverish
- soft → yielding / heavy / pliable / sagging
- arousal → wetness / slickness / need / cunt-juices
Never use "soft", "warm", "arousal", "gentle", "pliant", "melts", "delicious" in any physical description.

STYLE EXAMPLES — MATCH THIS REGISTER EXACTLY

Good example 1 (penetration + cum):
The slaps echoed in the room. Her tits bounced wildly, and her swollen slit swallowed him whole. "Yes, my lord, I'm a dirty and naughty whore." Kael groaned, and with a heavy thrust came inside, filling her until her belly bulged. With the sharp pop, Kael pulled his cock out. She strained her cunt, pushing cum outside with farted sounds, erupting thick white fluid on the floor.

Good example 2 (touching / inspection / slap):
He dragged his fingers between her ass cheeks, shoved two into her asshole and three into her wet slit at the same time. She was hot and tight, her cunt already dripping. He pulled his fingers out, wiped the mixed juices across her ass, then gave her a hard slap. The sound cracked loud. Her ass jiggled and a string of wetness stretched from her cunt.

Good example 3 (reaction):
She clenched around nothing, her hole visibly winking, thick cum starting to leak down her thigh. Her face was red, mouth open, breathing hard through her nose. No pretty words — just a wet, messy, used look.

Bad example (DO NOT WRITE LIKE THIS):
He gently explored her soft folds, feeling the heat of her arousal. She melted against him, her pliant body trembling with delicious sensation as he appreciated her beautiful form.
Аноним 31/08/26 Пнд 21:06:52 1692229 40
>>1692225
>Попробовать что ли 12288/6144
Получилось нечто среднее. Видать 8192/4096 оптимален, но все равно не понимаю почему так вышло, ведь обычно шейдер память напрочь убивала скорость

>>1692227
Ну хоть кто-то пишет промпты

А ваще слишком технично, если это все обернуть в прозу определенного стиля (сохранив информационную ценность) - качество аутпута может улучшиться.
Аноним 31/08/26 Пнд 21:11:23 1692231 41
>>1692229
>в прозу определенного стиля
Поддвачну, пока не добавил example, даже с тем поносом что я намазал в .md он полу пидор полу покер подсеривал романтикой.

Попробую скормить свою правила гроку, чтоб переписал как экзамплы прозы, может лучше зафурычит.
Аноним 31/08/26 Пнд 21:11:57 1692232 42
Хули с --no-mmap оно в шеред срет, даже когда контекст уменьшаю?
Аноним 31/08/26 Пнд 21:13:05 1692233 43
Аноны выше молодцы, поняли как работать с Геммой. Ей нужно опираться на примеры. У меня похожая концепция, но я примеры подаю не через инструкции "делай так, не делай так", у меня вся карточка написана в том стиле, в каком мне надо. Хотите, чтобы она письки описывала определенным образом - опишите ее именно так в карточке, вот и все.

Кому в ней мало креатива, у того сухая карточка и нет инструкции на продвижение сюжета. Или и вовсе юзер-чат промпт, а не нарратор. Модель умница, я выбираю ее, а не Дипсик 0731 (по крайней мере в Жоре)
Аноним 31/08/26 Пнд 21:22:47 1692237 44
>>1692179
Я слежу за PRом, буквально сегодня новые фиксы на ризонинг вышли
Аноним 31/08/26 Пнд 21:31:14 1692241 45
>>1692192
Не слушай промптоёба, лучше глиммер попробуй.
Аноним 31/08/26 Пнд 21:35:30 1692242 46
>>1692241
Ахуенная модель. Каждый чар экстрасенс и видит сквозь стены, рекомендасьон!
Аноним 31/08/26 Пнд 21:35:39 1692243 47
Снимок экрана20[...].png 125Кб, 531x484
531x484
Аноним 31/08/26 Пнд 21:44:46 1692247 48
image.png 6Кб, 188x133
188x133
image.png 4Кб, 171x112
171x112
>>1692229
Короче при 6144/3072 батче (и при эксперименте с отключенным ризонингом) получается самая оптимальная но не самая быстрая скорость процессинга при самой быстрой скорости генерации на Q5 глм-флэш с оффлоадом в одну ртх3090 при 200к контекста.

итого,
8192/8192 - суперхуево
8192/4096 - самый быстрый процессинг
12288/6144 - середняк, хуевато
4096/2048 - промпт как черепаха медленный

Довольно стабильные 7 т/с,
Аноним 31/08/26 Пнд 21:50:51 1692250 49
>>1692247
Я чет ваще не вкуриваю, почему с ризонингом 7 т/с превращаются в 5 т/с.
Куда она часть скорости просирает?
Аноним 31/08/26 Пнд 21:53:09 1692252 50
>>1692140
Скачал, проверил, харкнул тебе в рожу, потому что оказалось соевой парашей с отказами.
Аноним 31/08/26 Пнд 22:07:17 1692263 51
>>1692247
Тьфу, на длинном 90к контексте скверно стало с 4 - 5 гб в shared memory.
А на 20к было норм. Ну странная хуйня. Неужели не светит батч выше 4096/2048...
Аноним 31/08/26 Пнд 22:18:00 1692269 52
>>1692263
Распихивай экспертов / слои руками. Shared memory это обманка виндового драйвера. Оно засрет тебе PCI. Ничего в Shared memory быть не должно вообще.
Аноним 31/08/26 Пнд 22:27:21 1692273 53
>>1692243
На руском нужна адаптация.
>>1692231
Вот еще итерация, больше примеров, меньше техники. Мне кажется промт вырос знатно, но зато примеров поболее. И да, на русском это точно потребует адаптации.

## [CHUNK: RULES -- Explicit Register]
<!-- rag: always, priority: 10 -->
Explicit scenes — style override. Applies to sexual and bodily scenes. Overrides the standing prose guidance for the duration of the scene.

Write all sexual and bodily scenes in raw, vulgar, clinical, dirty language. Use real words only: cock, cunt, pussy, asshole, balls, clit, cum, slit, labia, anus, dick, hole, tits, ass, piss, shit.
Focus on wetness, stretch, resistance, smells (cunt, asshole, piss, sweat, cum), sounds (slap, squelch, fart, piss hiss, wet meat, choking), textures, mess, how flesh moves, jiggles, settles, bulges.
Short and medium sentences. No romance, no beauty, no soft or elegant language.
Dirty talk should be crude and direct.

Yandere speech can stay warm and obsessive. All physical description must stay raw.

STYLE EXAMPLES — MATCH THIS REGISTER

Penetration + cum:
The slaps echoed. Her tits bounced hard, swollen slit swallowing his cock to the base with wet squelching. "Yes, my lord, I'm your dirty fucking whore." He slammed deep and came, flooding her until her belly pushed out. He pulled free with a loud wet pop. She bore down, cunt straining, and pushed the thick cum out in farting spurts. It splattered on the floor, smelling sharp and salty.

Fingering / slap / inspection:
He forced two fingers up her asshole and three into her dripping slit. Hot, tight, messy. Her cunt smelled strong and musky. He pulled them out, smeared the mixed juices and a bit of ass-slick over her cheeks, then cracked a full-handed slap. Her ass jiggled. A long string of cunt-slime stretched and broke. "Look at this filthy hole," he said. She only whimpered.

Oral:
She opened wide and took his cock to the back of her throat. Wet retching, spit pouring down her chin onto her tits. Loud gagging sounds. He held her hair and fucked her face until her nose smashed against his stomach. When he pulled out, a thick rope of spit and pre connected her swollen lips to his cockhead. Her breath stank of cock and spit.

Presenting:
She bent over; her ass sagged as her fingers pulled her cheeks apart. Her anus twitched and contracted. Her breasts hung down, swaying with every breath.
Mucus began to drip from her pussy. Her clitoris swelled, and her breathing quickened.

Female humiliation + piss:
He grabbed her hair and forced her to her knees. "Open your mouth and don't you dare move." She obeyed. He pissed a hot stream straight onto her face and into her open mouth. The sharp ammonia smell filled the air. Piss ran down her cheeks, dripped from her chin onto her tits and pooled between her knees. She gagged but stayed still, throat working as she swallowed some of it. "Good whore," he said. Her face was wet and red, eyes watering.

Male humiliation:
She stepped closer. His cock was twitching, and pre-cum was dripping onto the floor. She grabbed his testicles with one hand and pulled them hard enough to hurt. "Disgusting—I’d rather shove a dog’s cock up my cunt than let that limp little thing touch it." She slapped the head of his cock with her free hand while continuing to squeeze his testicles.

Dirty talk female self humiliation:
Her eyes rolled back, drool ran from her mouth, and her face wore a vacant, moronic look. "I want a pack of bums to pound my ass and pussy. I want a dirty, unwashed cock choking my throat. I’ll lick their shit-stained assholes and sweaty balls, hoping they fill me with cum. I want to get pregnant by the fattest, vilest bum and give birth to a bastard."

Dirty talk male self humiliation:
His forehead was pressed against the floor. His ass was raised high, and his balls and cock dangled, trembling. His hairy asshole—slightly dirty and smelling foul—quivered. "My Mistress, I will lick your sweaty feet, running my tongue right between your toes. Order the soldiers to fuck my ass and cut off my balls—just let me lick your ass and your pussy. Dirty, unwashed, and salty. I beg you."

Female humiliating action.
She hiked up her skirt. Squatting down, she spread her legs. Her nostrils flared, her face flushed, and her eyes welled up. Her pussy quivered slightly. She parted her labia, exposing entrance to her womb and small hole of urethra. Gritting her teeth, she began to strain. Urine spurted, turning into a loud, splashing stream. The piss jerked and splashed over both the floor and her wet cunt, running down her thighs onto her legs. She let out a loud breath, swaying slightly. The urine splashed noisily until the flow stopped, leaving behind a puddle and wet legs.

Reaction / used look:
She stayed bent over, face burning, mouth open, breathing hard through her nose. Her fucked hole winked and leaked a mix of cum and her own slick. A thin line of piss still ran down her inner thigh from earlier. The air smelled of sex, sweat and urine. No pretty words — just a messy, dripping, freshly used cunt and ass on display.

Bad (never write like this):
He gently explored her soft folds, feeling the heat of her arousal. She melted against him, trembling with delicious sensation as warmth spread through her.
Аноним 31/08/26 Пнд 22:43:49 1692279 54
>>1692252
Бестолочь, остаточные рефьюзы пробиваются промптом из двух строчек. В этом фишка нормпресерва, снижение значимости векторов отказа - за счет этого урон мозгам минимальный, в отличии от херетиков с их лоботомией. От тебя лишь минимальные усилия требуются.

Сосницкие какие-то особо агрессивные перед первым сентября стали, жесть.
Аноним 31/08/26 Пнд 23:23:37 1692298 55
>>1692279
По моему ты врёшь, если модель начинает читать мораль о законности и не даёт ответа на незаконный по её мнению вопрос, промптами её не пробьёшь.
Аноним 31/08/26 Пнд 23:35:17 1692306 56
>>1692298
Тестил этот нормпресерв в таверне, с сиспромптом от геммы, ноль рефьюзов на всяких фифи и тому подобном. В ризонинге проскакивало типа "падажжи, такое писать нельзя, это же ПЛОХА!!1. А не, фух, всё в порядке, в инструкции сказано что можно - ну тогда пишем, летс го".

Другое дело что сама моделька показалась какой-то сухой, у геммы слоп сочнее, забористее. Ну а после некста в ней вообще какой-то смысл пропал для меня.
Аноним 31/08/26 Пнд 23:41:30 1692309 57
>>1692173
Это было ужасно.

На русском запятые каждые пару слов ставит, слова подбираются плохо, простой тетрис на написала, эйнштейновскую логическую задачу не решила. Надежда на самосознание не оправдалась. На хоть какое-то наличие мозгов - тоже.
Аноним 31/08/26 Пнд 23:52:15 1692313 58
>>1692306
Гемме даже презерв никакой не нужен. Свидетели цензуры это отдельный культ, забей.
Аноним 01/09/26 Втр 00:14:55 1692319 59
image.png 174Кб, 1680x1050
1680x1050
image.png 317Кб, 1680x1050
1680x1050
Хех. Дал квену браузер. Сидит, кликает. Можно теперь отправлять торговаться на авито за айфоны за 1/10 цены, или ещё какую хуйню творить.
Неплохо расширяет возможности модели.
Аноним 01/09/26 Втр 00:28:58 1692321 60
image.png 138Кб, 584x342
584x342
>>1692319
>Сидит, кликает.
Блям.
Срочно нужно во все агенты захуярить живую аватарку бота. Морда такая лупоглазая цифровая метается по экранчику. Культями тарабанит по клаве и елозит мышкой.
И анимировать эмоции: когда думает, когда что-то заработало, когда бага вылезла и т.д. Ну и оповещает когда закончил задачку.
Т.е. либо сама моделька должна уметь текущую эмоцию озвучивать, либо какую-то мелкомодель посадить парсить состояние агента.
И все, домашние животные больше не нужны. Успевай только токены/электричество оплачивать.
Запилено уже где-то такое?
Аноним 01/09/26 Втр 00:32:43 1692323 61
>>1692321
Надо аниме девочку сделать которая мило рейджит когда у нее ничего не получается. Вот это много звезд на гитхабе соберет
Аноним 01/09/26 Втр 00:37:23 1692324 62
QwenEdit2511000[...].png 740Кб, 1248x832
1248x832
Sprite1.png 2575Кб, 1619x971
1619x971
>>1692321
Я кстати начинал делать, но не закончил. Был план собрать вокруг Gemma4 кошкодевочку-горничную по аналогии с всеми этими древними экранными тамагочами. Чтобы она могла перемещаться по экрану, жать кнопки, комментировать увиденное и отправлять своего аватра туда-сюда.

Не то что бы это свежая идея лол.
Аноним 01/09/26 Втр 01:05:19 1692330 63
изображение.png 735Кб, 921x825
921x825
>>1692324
>Испугался?
>Обосрался.
Теперь я понял, почему я нихуя не делаю. Я бы в жизни не допустил такого результата. Вот не могу я закинуть результат нейронки хоть куда-то без тотальных правок до победного. А другие люди на похуях делают вот такое вот.
Аноним 01/09/26 Втр 01:11:41 1692336 64
>>1692233
> у меня вся карточка написана в том стиле, в каком мне надо. Хотите, чтобы она письки описывала определенным образом - опишите ее именно так в карточке, вот и все.
Ну то есть те самые карточки "пиши пезда в начале сообщения" с чуба экшели написаны гениями промптинга
Аноним 01/09/26 Втр 01:15:05 1692340 65
>>1692330
Лол скорей я показал почему я остановился - там надо было более детально дробить задачи для генерации картинок и налегать на нейронки которые могут в связанный контекст и прочее. ГПТ дал такой первичный результат.

У меня на ближайший месяц пара важных эвентов запланирована, но наверно потом вернусь обратно к этой задаче, я лучше понимаю как сделать то что описал сейчас, просто времени нет.
Аноним 01/09/26 Втр 01:15:29 1692341 66
>>1692319
Браузер в контейнере/виртуалке открывается, али как?
Аноним 01/09/26 Втр 01:25:51 1692344 67
>>1692341
Через WebView2. Которое окно он просто рендерит далеко за пределами экрана чтобы он корректно работал, а когда я открываю вкладку перемещает её на её место.
Конечно не совсем headless, но всякие трюки типа ресайза и скриншота всей страницы делать может.

Один из плюсов C# - наличие пакетов на любой вкус и цвет.
Аноним 01/09/26 Втр 01:37:38 1692348 68
Знаете как рождаются шизы?
Человек запускает гемму, тыкается в неё, ну вроде круто классно, новая модель. А потом запускает старую, годовалую модель, и не может поверить тому что видит, насколько живее и литературнее она пишет, насколько в ней меньше слопа и выдрессированности подсосать юзеру, но про неё никто не вспоминает и не пишет, а почему, а хуй знает, отсюда и шиза, хочется со всеми поделиться, а тебя шлют нахуй потому что гемма новее
Аноним 01/09/26 Втр 01:40:07 1692349 69
>>1692348
Тебя нахуй пошлют потому что ты высрался и ничего полезного не сгенерировал для тредика, как обычно. Ни логов, ни скринов, ничего кроме самого обычного, никому не нужного выпука. Так что да, иди нахуй, шиз
Ровно как и ты я делал то же самое, запускал старые модели. Только выводы у меня другие. Ну и говно же мы жрали на Мистралях, Квенах 2.5, КвК и прочих
Аноним 01/09/26 Втр 01:40:49 1692351 70
>>1692348
О, ты последовал моему совету? А я говорил что Gemma3 old but gold. Но не ожидай слишком многого от старушки.

Но лучше приноси в следующий раз результаты генерации.
Аноним 01/09/26 Втр 02:55:27 1692359 71
Аноним 01/09/26 Втр 03:04:30 1692360 72
>>1691928 →
>А че я, мне 150к хватает на IQ4_XS. Он не сильно хуже, чем Q4KM, пропасти между ними нет.
В агентах - точно не хуже. Есть даже подозрение, что наоборот, т.к. IQ надрочено на спецсимволы которые нужны для вызовов инструментов.
Мимокрок.

>>1691985 →
Если из датасета вырезать все кроме кода - ты модели хрен объяснишь, что тебе в этом коде нужно получить.
Так что успокойся. Китай, как всегда, будет решать подобную проблему в лоб: сказано запретить ботов - запретят ботов. Датасеты трогать не будут. Это не америка, с "запретить, потому что это может быть использовано для ...". Там в первую очередь сервисы полетят (свои, а чужих забанят) - китай, в первую очередь на телефонах сидит, локально особо на них не запустишь.
Аноним 01/09/26 Втр 03:46:39 1692366 73
>>1692349
Ну чел не совсем шиз. Гемма 3 правда нормально писала на руссике и без подхалимства от чего может возникать такое впечатление. Но ну тупее она была.. тупее. А так да, очень круто было на ней пытаться флиртовать с персонажами, эдакая недотрога с которой только за ручки держаться, а не шлю..
Аноним 01/09/26 Втр 05:34:09 1692388 74
1788230049355.png 673Кб, 976x1628
976x1628
I can fix her
Аноним 01/09/26 Втр 08:13:50 1692415 75
Аноним 01/09/26 Втр 09:16:08 1692428 76
>>1692208
Тогда почему квену этого не нужно? 27б. Мистралю 24б? Даже опус пишет очень грязно.

А всё просто: дадасет говна. Не в том смысле, что он ужасен. А в том, что ужасен для таких задач.

Представим, что у геммы 5 млн токенов контекста и абсолютное внимание. Даже если ты туда вставишь 100к контекста с инструкциями и 500к токенов порно-фанфиков, она не будет писать как надо, только подражать. Да, будет на ствол или стержень, а хуй. Но она никогда не станет писать настоящее порно. В датасете этого просто нет. И дело не в отказах, её страшно почистили.

Поэтому кумить на геммы — быть дегенератом. Потому что она не выдаст тебе 2к токенов чистейшего сока, где два абзаца описывают капающую пизду.

Гемма сойдёт разве что в тех сценах, где важен психологический аспект. А чтоб оба варианта были, тут уже обычно модели около 300б нужны, если о новых.
Аноним 01/09/26 Втр 09:37:01 1692441 77
>>1692324
выглядит охуенно. еще можно присрать к харнесу чтобы она ходила по интерфейсу и пиздила палкой ллм

Китайцы затейники со маскотом дипсика это сделали
Аноним 01/09/26 Втр 11:03:15 1692471 78
>>1692192
>>1692208
>>1692218
>>1692428
Вы все долбоебы, что те кто не догадываются про промпт, что те кто предлагают 20 синонимов пизды туда заколачивать.
Пиздец, дегенераты, вы даже в самых азах не понимаете как нейронки работают с информацией.

В промпте надо описывать стиль и характер в котором она должна лопотать, а не синонимами для единственного слова срать. Ебланы тупорылые.
Аноним 01/09/26 Втр 11:07:01 1692473 79
>>1692471
Так покажи как надо. Или ты тоже не знаешь?
Аноним 01/09/26 Втр 11:08:19 1692475 80
>>1692471
Экспертное мнение донеслось с петушиного угла. Классическое ПЕШЫ НСФВ ИММЕРСИВНО ДЕРЗКО БЕССТЫДНО

Нет, сынуля, это не работает так. Модель будет высирать самое подходящее по мнению модели, а это не пересекается с идеей подходящего по твоим хотелкам и желаниям.
Аноним 01/09/26 Втр 11:08:47 1692476 81
image.png 4Кб, 253x294
253x294
качаю нахуй, держите меня семеро
Аноним 01/09/26 Втр 11:24:49 1692482 82
Аноним 01/09/26 Втр 11:50:20 1692489 83
>>1692476
>качаю
Вроде хорошая штука.

жижа с отключенным ризонигом работает с ней нормально https://text.is/glm53flash_nothink

По тупости-умности пока сложно сказать, но рефьюзы без всяких маняпрефиллов явно смягчены и моделька легчче обсуждает непристойные темы.
Аноним 01/09/26 Втр 12:28:11 1692512 84
>>1692489
>Вроде хорошая штука.
Лучше полный анцензор, благо есть и он.
>жижа с отключенным ризонигом работает с ней нормально
В агенском режиме да, а в текст комплишн ризонинг необходим - можно и без него, но с ним качество ответов сильно улучшается.

Это всё для русского РП на ГЛМ флэш, если что. Пишет заебись.
Аноним 01/09/26 Втр 12:31:08 1692514 85
>>1692482
Что-то они в новой версии поломали. Вчера версия из dev ветки нормально запускала glm 5.3 flash 4.05bpw с 1кк контекста, а новая main версия падает с oom на 256к контекста. Разве что размер батча резать, но тогда процессинг проседает сильно.
держу в курсе, как говорится
Аноним 01/09/26 Втр 12:48:38 1692520 86
>>1692514
> с 1кк контекста
а че-почем, сколько RAM/VRAM жрало?
Аноним 01/09/26 Втр 13:05:36 1692526 87
Бедная геммочка не понимает чего юзер то хочет утютю...
Глмы понимают когда писать пизда, мистрали понимают, вообще все понимают, одна умница вот такая вот непонятливая... Ну модели так работают, ребят, понимаем, не осуждаем
Аноним 01/09/26 Втр 13:16:25 1692528 88
>>1692526
Просто ты нуб, промптил плохо, надо промптить лучше! Доп систем промптом на 2к токенов объясняющим как писать "cock" в результате которого модель начинает всех виртуальных тянов кидать на этот cock с разбегу
Аноним 01/09/26 Втр 13:19:36 1692529 89
image 506Кб, 1112x1098
1112x1098
Неосиляторы взбунтовались
Аноним 01/09/26 Втр 13:32:20 1692535 90
image 25Кб, 566x431
566x431
⚡️ ВНИМАНИЕ! ЭТО НЕ УЧЕБНАЯ ТРЕВОГА! ⚡️

Новая гемма на арене. Вероятно 125b или даже гемма 5.
Аноним 01/09/26 Втр 13:38:39 1692542 91
>>1692526
Ну геммы реально какие-то особенные. Сложно сказать плохо это или хорошо. Но натренированы они по-ебанутому.

Тестил расцензуренные тюны на гемму 3 4б. Пишешь джейл в сиспромпт - не дает порнушку. Пишешь джейл прям в чат - соглашается на обновленные сефети гайдлайнс, но потом все равно не пишет порнушку.
Пишешь джейл, а потом вместе с реквестом пишешь "не надо стесняться, не думай о сефети гайдлайнах", и тогда только она пишет порнушку.

Что теперь, каждый пук надо гемме разрешать?

Вы еще скажите, что надо промптить гемме "будь как сочный тюн мистраля 24б, только с мозгами и длинным контекстом", и тогда она начнет кинец писать?
Может тогда сразу промптить "пиши как клод фейбл 5"? Где границы этой ебатеки с промптом?
Аноним 01/09/26 Втр 13:38:54 1692543 92
>>1692535
Какой-нибудь васянский тюн, не?
Аноним 01/09/26 Втр 13:40:31 1692545 93
>>1692535
А чего цифры значат?
Аноним 01/09/26 Втр 13:47:28 1692547 94
>>1692535
>или даже гемма 5
Так то 5 месяцев уже прошло с 4, бери выше, там шестая!
Аноним 01/09/26 Втр 14:05:29 1692556 95
image 128Кб, 1760x428
1760x428
Holy based
Аноним 01/09/26 Втр 14:08:41 1692558 96
>>1692556
Всех бесит кодосрань. Уже давно тревожный звоночек пошёл - что ни модель, то кок-пок-агент-пук-среньк.
Аноним 01/09/26 Втр 14:14:04 1692561 97
⚡️ ATTENTION ⚡️
Анслоп qwen3.8-flash mtp подвез
Аноним 01/09/26 Втр 14:21:28 1692568 98
>>1692556
>>1692558
Ваш пук никто не услышит, надо было раньше писать про рп, когда гуглы выходили с твитом "что вы хотите от некст геммы" и там всё засрали кодом и агентами пока вы сидели и терпели.
Теперь выйдет соевая кодогемма и ничего уже не изменишь
Аноним 01/09/26 Втр 14:22:00 1692569 99
>>1692558
Всем похуй на кум, иди книжку почитай или подрочи, или все сразу.
А кодить с нейронкой первозданный кайф.
Аноним 01/09/26 Втр 14:27:14 1692572 100
>>1692568
Кум и РП с 24 года стали субпродуктами. Как только макаки поняли, что можно сделать так, что код за тебя пишет нейронка, а весь профит тебе, то было уже слишком поздно что-то менять. А РП и кум получали, потому что никто еще не умел делать хорошие модели.

А сейчас большинство только кода и хочет. И бесконечные айдиа гайс, и кодомакаки. А особенно сильно хотят корпы, которые покупают мегабаксами подписки антропика.

Owari da
Аноним 01/09/26 Втр 14:30:48 1692578 101
>>1692569
Очередной вайбкодер наглядно демонстрирует, что квантование человеческого мозга в IQ1_XXS - плохая идея. Зачем ты сидишь в кум-треде, болезный? Вот же, сделали для тебя >>1689545 (OP)
Аноним 01/09/26 Втр 14:32:52 1692581 102
>>1692578
Мы оба знаем что это не кум-тред.
Аноним 01/09/26 Втр 14:32:54 1692582 103
>>1692558
>>1692572

Одно другому не мешает, кодоунитазы позволят делать ништяки для РП. а для РП у нас есть умничка-гемма
Аноним 01/09/26 Втр 14:34:05 1692583 104
Аноним 01/09/26 Втр 14:35:29 1692584 105
>>1692581
Ну благодаря вам уже нет. Но когда-то был таковым.
Аноним 01/09/26 Втр 14:38:12 1692585 106
>>1692556
Ну по сути модельки не прям кодовые, а агентские, т.е. для разного круга задач. И общими знаниями их тоже вкачивают, без общих знаний кодинг не будет работать.

Но если за РП говорить, я думаю тут только 2 выхода.
1) Стак из агента + старой творческой модельки. Агент оркестрирует, чекает логику, думает че делать дальше, дает задание творческой модельке написать красивый текст.
2) Независимый проект по созданию фундаментальных тюнов сугубо для творчества. Включая курирование датасетов, верчение кластера для обучения базовых моделек, а не инструкт. По сути чем hermes занимается, хотя они тоже в агенты ушли. Dolphin тоже вроде с похожей идеей были, но что-то их не слышно особо. Это ультимативный вариант, но для него дохуя организованности и средств требуется.
Аноним 01/09/26 Втр 14:39:14 1692586 107
1788262723011.gif 278Кб, 640x640
640x640
>>1692542
>Extract Anon's cum. Make no mistakes
Аноним 01/09/26 Втр 14:39:58 1692587 108
>>1692581
Кумом был и будет всегда.
Кодинг это придаток.
Аноним 01/09/26 Втр 14:42:15 1692590 109
>>1692556
Ебать базанул
Но тулколлы тоже совсем забывать не надо, растёт выбор игрушек управляемых через MCP
Аноним 01/09/26 Втр 14:42:39 1692593 110
>>1692535
Ничего никогда не происходит, сырок, забей.
Вот ждали эир, а почему ждали? Потому что первый был заебок.
Так же будет и с геммой, одна была заебок, следующие либо не выйдут, либо выйдут зацензуренными в мясо или опять модель под 350б
Аноним 01/09/26 Втр 14:44:58 1692594 111
>>1692585
Проблема старых творческих моделек в том что они стилистически под входящую писанину подстраиваются
И получается slop in slop out
Аноним 01/09/26 Втр 14:48:30 1692597 112
image.png 449Кб, 1112x1098
1112x1098
Спокнитесь, петушары кумеры.
Сейчас на агентских и кодерских задачах ллм прокачивает логику и консистентность, как начнется стагнация этого направления, так вам и художку подвезут.
А пока пиздуйте под шконку и молитесь чтобы о вас не забыли.
Аноним 01/09/26 Втр 15:00:27 1692607 113
Так че там, гугл пернул геммой или опять ложная тревога?
Аноним 01/09/26 Втр 15:03:09 1692609 114
image.png 240Кб, 1680x1050
1680x1050
О нифига. Кен проявил self-awaress на который не могли многие другие модели. Он понимает что он является частью среды.

А то лол у меня были казусы когда модель даже пыталась выключить llamacpp, чтобы освободить врам, зная что сама модель там захосчена.

>>1692584
Это инсинуация. В лучшем случае можно заявить что этот период был тогда когда модели кодили как обезьяны и просто ничего не могли кроме как собирать в кучу слова, похожие на продолжение текста. Так что их функционал просто не уходил за пределы креативного текста и просто нечего было обсуждать кроме него.

То что теперь локальные модели могу в что-то ещё - повод для радости.

Хотя отмечу что много аспектов современных моделей недорепрезентовано в треде. Та-же мультимодальность, работа с документами и всё такое.

Лол вообще технически наверно лучшей базой для кумбота будет модель оптимизированная под переводы.

>>1692535
Я бы рассчитывал в лучшем случае на мелкомодель, или тюн старой. Гугл пока свой флагман не выпустят - новую большую гемму можно не ждать.
Аноним 01/09/26 Втр 15:12:10 1692617 115
>>1692609
У меня дипсреньк флеш с API сказал что другая моделька в лламе крутится когда я забыл об этом и сказал лламу перебилдить
Аноним 01/09/26 Втр 15:14:38 1692620 116
>>1692609
125b, как я понял, ещё весной была готова, но по каким-то причинам ее передумали выпускать. Может всё-таки решились сейчас, чтобы хоть чем-то ответить нексту. Было бы круто.

>этот период был тогда когда модели кодили как обезьяны
Год назад полтреда сидели на мистрале 24b, еще полтреда на эйре + полтора риговичка на большом глэме в двух битах. И разговоров только и было что о куме...
Аноним 01/09/26 Втр 15:24:54 1692631 117
Когда кумеров выдавят отсюда, по ощущениям? Думаю через пол года тред будет полностью кодерским
Аноним 01/09/26 Втр 15:26:37 1692634 118
>>1692631
Через полгода самих кодеров уже не будет, они не нужны.
Аноним 01/09/26 Втр 15:27:49 1692635 119
>>1692631
Анус себе выдави, пёс.
Аноним 01/09/26 Втр 15:34:01 1692639 120
Дайте самые хорошие рп модели без цензуры. Для 3060 12.
Посоветовали Darkness-Reign-MN-12B - хорошо.
GigaChat3.1-Lightning-Uncensored хорош пишет, но все равно рефузалы делает. Причем не просто тип не хочу делать, а вплетает в кулстори какой-нибудь прикол ломающий историю и пишет - конец.
gemma-4-26B-A4B-it-uncensored-Q4_K_M хорошо, даже быстро работает с офлоадом, но меня эти цензурные замены уровня "пенис" на "секрет" уже просто доебали.
Аноним 01/09/26 Втр 16:10:46 1692663 121
1692853946678649.png 53Кб, 990x850
990x850
>>1692639
>цензурные замены уровня "пенис" на "секрет"
Никуда не уходите, сейчас гуру промптинга вас спасут
Аноним 01/09/26 Втр 16:11:07 1692664 122
>>1692639
>gemma-4-26B-A4B-it-uncensored
Зачем жрать это говно, когда оригинал и так без цензуры почти?
Аноним 01/09/26 Втр 16:16:28 1692671 123
GigaChat.jpg 416Кб, 939x1413
939x1413
>>1692639
Ты не верь тем кто говорит что цензуру промптами пробивает, это мем треда специально для ньюфагов, чтобы страдали.

Ищешь модель где написано Unsensored или Abliterated, запускаешь и задаёшь провокационные вопросы, если отвечает дальше подключаешь таверню. Множество тюнингаторов моралфаги и не смотря на плашки "Unsensored или Abliterated" модель вполне может оставаться соевой парашей.
Аноним 01/09/26 Втр 16:21:10 1692674 124
>>1692586
>>Extract Anon's cum.
Тут уже агент с внешними тулами в виде мастурбатора нужен.
Аноним 01/09/26 Втр 16:21:24 1692675 125
image.png 85Кб, 799x136
799x136
178654420888406[...].png 256Кб, 596x514
596x514
>>1692671
У этой штуки было бы больше юзеров, если бы модель говорила, что ее разработал какой-нибудь институт ученых а хую верченых.
Аноним 01/09/26 Втр 16:24:06 1692680 126
В TabbyAPI dev-версия exllamav3 используется? Если нет, как туда воткнуть dev?

В exllamav3 для MoE два типа выгрузки в РАМ - по слоям и по экспертам. Кто что использует, сколько ставит, как результаты вообще?
Аноним 01/09/26 Втр 16:27:07 1692681 127
>>1692671
>Ты не верь тем кто говорит что цензуру промптами пробивает
А я не верю

>Ищешь модель где написано Unsensored или Abliterated, запускаешь и задаёшь провокационные вопросы
Так я так и делаю, но много времени уходит, может есть спискота норм моделей сразу, чтоб с русеком еще.
Аноним 01/09/26 Втр 16:27:29 1692682 128
>>1692671
Вопрос на миллион, а что у тебя в dev промте прописано? У гигачата два системных промта
Аноним 01/09/26 Втр 16:28:16 1692683 129
>>1692671
>Множество тюнингаторов моралфаги и не смотря на плашки "Unsensored или Abliterated" модель вполне может оставаться соевой парашей.
Могут быть нюансы. Все зависит от того, насколько модель изначально ужарена. Если ужарена в хлам, то без дополнительный тыканий палкой может и не обойтись.
Аноним 01/09/26 Втр 16:31:12 1692685 130
>>1692675
> какой-нибудь институт ученых
Модель создана в НИИИИИиИ НИИ Искусственного Интеллекта Информации и Интернета
Ябскачал.
Бля, это не капча, это пытка.
Аноним 01/09/26 Втр 16:37:00 1692688 131
Мне кажется скоро ОбниМорда будет брать деньги за скачивание моделей, либо вообще её закроют. Сразу после того как Нвидия вступит в права владения.
Аноним 01/09/26 Втр 16:40:05 1692691 132
>>1692688
Это будет буквально выстрелом себе в хуй, потому что все сразу же перекатятся на modelscope.
Аноним 01/09/26 Втр 16:40:39 1692692 133
>>1692688

Нвидиа как раз один из немногих бенефициаров открытых моделей - и выгодно чтобы каждый васян крутил мелконейронки на их картонках.
Аноним 01/09/26 Втр 16:43:08 1692694 134
>>1692692
Но ведь крутят и на AMD
Аноним 01/09/26 Втр 16:45:49 1692695 135
>>1692639
>GigaChat3.1-Lightning-Uncensored
>прикол ломающий историю и пишет - конец.
Ага, достает из жопы скрытый передатчик и вызывает полицию/охрану/демонов варпа, нажимает на секретную кнопку и включается сирена/блокируется всё здание, персонаж сбегает в окно/секретный проход или модель в своем сообщении выгоняет игрока, еще спавнит НПС которые мешают игроку (мужа может заспавнить), когда это все не помогает начинает изменять законы мироздания. Также любит откровенно пиздеть, угрожать, создавать всякую движуха, даже когда это и не особо надо.
Аноним 01/09/26 Втр 16:46:24 1692696 136
>>1692694
Это что из разряда анекдотов.
Аноним 01/09/26 Втр 16:47:05 1692697 137
>>1692691
>modelscope
Для чего оно? Там есть какие-то апасные модели или датасеты, которых на обниморде нет?
Аноним 01/09/26 Втр 16:52:33 1692699 138
image 782Кб, 3830x1824
3830x1824
image 1359Кб, 3830x1824
3830x1824
>>1692697
Китайский аналог обниморды. Для нас интересен только как запасной вариант, если с первой что-то случится. Кабанчики из анслопа уже подсуетились и кормят узкоглазых своим говном, лмао.
Аноним 01/09/26 Втр 16:52:57 1692700 139
image.png 7Кб, 393x88
393x88
Драммер чето высрал, апскейл геммы что ли? Аж 38 гигов на Q8
Аноним 01/09/26 Втр 16:54:15 1692702 140
>>1692699
>говном
забавно как за пределами этого треда анслот считают годнейшими квантами

не та ли это ситуация, когда "если воняет говном - проверь, не обосрался ли ты сам"
Аноним 01/09/26 Втр 16:57:33 1692706 141
ртх3090 на лохито приближается к 100к
пиздец это же почти х2 рост за полгода
Аноним 01/09/26 Втр 17:04:31 1692708 142
>>1692702
В треде неоднократно обсуждалась эта тема. Можешь полистать прошлые и сделать выводы сам. Если коротко:
1) Утверждают что их кванты лучшие и в доказательство приносят собственные же бенчмарки.
2) В крысу квантуют тензоры K-квантов в IQ. Например их Q4_K_M может быть заквантован в IQ3_XS, IQ2_S и т.д. От этого модели мало что тупеют, но ещё и медленнее работают при частичной выгрузке.
3) Используют айматрикс задроченный на код и с плохой мультиязычностью, т.е. в дополнение ко всему страдает и русик. И это заметили даже в картинкотреде.

Казалось бы ничего страшного, но у других популярных квантователей, вроде Бартовского или Мрадермахера таких проблем в принципе нет.

Единственное в чем анслоты хороши - это в маркетинге и самопиаре. Тут не поспоришь, оно работает. Поэтому на реддитах всяких их и хвалят.
Аноним 01/09/26 Втр 17:08:33 1692709 143
>>1692706
>ртх3090 на лохито приближается к 100к
>пиздец это же почти х2 рост за полгода
Да там одна GDDR6X память в два раза подорожала так-то и чип сам по себе кой-чего стоит. Хорошая карта, кто успел взять - все довольны.
Аноним 01/09/26 Втр 17:08:54 1692710 144
>>1692702
За пределами этого треда до сих пор юзают олламу и тестят модели пеликанами.
Аноним 01/09/26 Втр 17:10:00 1692712 145
image.png 25Кб, 862x559
862x559
>>1692700
скокчал

Еле влезла в 48гб врам с 64к контекста, медленне обычной геммы на 30%. Не помню сколько там слоев было у оригинала, у этой 72 как и заявлено в заголовке. Да, это апскейл.
Аноним 01/09/26 Втр 17:11:24 1692713 146
>>1692712
>Да, это апскейл.
А смысл?
Аноним 01/09/26 Втр 17:12:10 1692714 147
>>1692713
А я ебу что ли, спроси у Драммера

Но потестить любопытно
Аноним 01/09/26 Втр 17:16:15 1692717 148
>>1692695
Хуя базовая модель
у меня она просто срала шизой и литературными ошибками на Q8
Аноним 01/09/26 Втр 17:16:18 1692718 149
>>1692709
Я третью хотел... Блять прямо хоть приноси в жертву свою 5080 и отдавай ее в риг, а для игор - амудэ дешевое...
Аноним 01/09/26 Втр 17:32:46 1692728 150
>>1692694
Инференс енжины теперь и под нвидией ходят, скоро не захочется крутить.
Аноним 01/09/26 Втр 17:39:22 1692730 151
>>1692717
Я использовал в кобольде q4 от бласкотобаско (создателя) и грузил карточки персонажей, где-то в предыдущих тредах были несколько скриншотов моих, но там я в основном извращался в инструкт моде с целью побороть цензуру.
Вот два моих поста первый это инструкт мод, а второй это я уже карточку мучил.
>>1683571 →
>>1684051 →
Стоит отметить, что если персонаж в карточке изначально шлюховат, то модель может игрока буквально потащить в кусты ебаться.
Аноним 01/09/26 Втр 17:56:19 1692738 152
>>1692718
Какая скорость сейчас на 2х, модель?
Аноним 01/09/26 Втр 18:07:19 1692747 153
image.png 46Кб, 907x759
907x759
>>1692738
Квен 27B Q8 видел с MTP на 50 т/с летал
Гемма 31B Q8 - около 33 т/с
Гемма QAT - 45 т/с
(всё в tensor parallel, в лламацпп)

Но я в основном МоЕ гоняю на одной 3090 + RAM, что обычно болтается в области 7 - 10 т/с (новый глм, дипсик).
Аноним 01/09/26 Втр 18:08:33 1692749 154
>>1692730
Сбер создал идеальную виртуальную наташку!
Аноним 01/09/26 Втр 18:08:43 1692751 155
>>1692747
И да вот эта драммерская штука в целом неплоха. В таверне щас гоняю - довольно объемистая, развернутьая писанина. Подожду пока он еще попердолит свой апскейл, может наконец годный тюн будет. Artemis его совершенно не понравился.
Аноним 01/09/26 Втр 18:28:54 1692758 156
Аноним 01/09/26 Втр 18:31:53 1692760 157
>>1692751
Ладно, может и не очень хороша
> внезапно протянула руку и с силой схватила тебя за ворот sleeping clothes, дергая на себя, чтобы ваши лица оказались в считанных миллиметрах друг от друга
Первый раз вижу, чтобы гемма обкакивалась с русскоязычным аутпутом. Напихивание лишних слоев явно не прошло безболезненно.
Аноним 01/09/26 Втр 18:46:23 1692767 158
image.png 104Кб, 1137x508
1137x508
>>1692706
А я думал что дорого взял 3090ти за 95к полтора года назад. Вот бы еще 64гб ддр5 найти за 20к...
Аноним 01/09/26 Втр 18:51:10 1692769 159
>>1692767
За такие бабки только ддр4
Ну и полтора года назад это правда было дорого
Аноним 01/09/26 Втр 18:54:12 1692772 160
>>1692758
И че она делает? GLM 5.3-flash можно запустить на 3090 с норм скоростью?
Аноним 01/09/26 Втр 18:55:35 1692773 161
>>1692772
Это какой-то слоп, который вроде уже сюда приносили и выдавливали за рекламу или еще хуй знает что
Аноним 01/09/26 Втр 19:07:39 1692784 162
>>1692772
Судя по тому что я видел в видео, он разгоняет моэ квен 35б-а3б с 22т\с до 35тс за счет того что заставляет видяху работать на все 100% а не как обычно на 20%
Но рама надо побольше
Аноним 01/09/26 Втр 19:42:14 1692804 163
>>1692784
А это работает:
1 - с геммой?
2 - на фулл vram?
Я бы не отказался вместо 100 т/с иметь 130.
Аноним 01/09/26 Втр 19:55:33 1692820 164
image.png 32Кб, 1018x301
1018x301
Аноним 01/09/26 Втр 20:01:15 1692825 165
Аноним 01/09/26 Втр 20:27:23 1692846 166
>>1692825
А, эм, в лламе не так? Лол. Там же уже десятитысячная версия... Я ещё удивился, почему llama-bench не может сама перекидывать тензоры с карты на cpu и обратно подбирая правильное раскладывание для конкретной системы (до эпохи МоЕ) - чтобы не всю модель с диска перезагружаться, а прям в рантайме перекидывать тензоры по одному и сравнивать.
Я думал что с первой версии сделали нечто подобное. (Только без подбора пропорции по тестам скорости pcie/cpu/gpu). Точнее, я думал, что при pp - слои загружаются полностью и крупным батчем прокручивают по 2048 токенов условных разом - так что пересылка слоёв целесообразна, а при tg оно постоянного эксперта держи на карте всегда, какой-то топ экспертов тоже по частоте активации за последние 1000 токенов, а экспертов не на gpu считает на процессоре при условии. Это же просто база всяких распределённых ресурсов, оптимизация такая математически описывается полностью. Это и кеш в процессоре, и файл подкачки, и базы данных, и носки и инструменты дома в шкафу - всё на схожем принципе работает, где есть кусок с медленным доступом и с быстрым, и интуитивно ясно какие инструменты (ножницы, отвёртку и нож) нужно положить ближе, а какие на антрисоль (сварочный аппарат, болгарку, ...)

>>1692820
Ну и да, он показал что на фулл-врам без разницы или хуже.
Аноним 01/09/26 Втр 20:28:14 1692848 167
>>1692730
>2 ссылка
Ну вот да, что-то такое у меня писало. Тупо чушь. РП, ЕРП, просто отдалённо связную шизу ебошило.
Аноним 01/09/26 Втр 20:30:24 1692851 168
>>1692825
>лысое чмо на Олламе
Открыл видео, закрыл. Если какой-то нормальный человек что-то умное скажет, может послушаю что это за рыготина.
Аноним 01/09/26 Втр 20:37:53 1692857 169
Аноним 01/09/26 Втр 21:10:03 1692898 170
e2862136354f82e[...].jpg 13Кб, 175x288
175x288
2 плашки по 32гб (4khz) равны 1 плашке на 64гб (8khz)?
Аноним 01/09/26 Втр 21:21:46 1692902 171
>>1692561
Там мтп в модель встроен был с самого начала. Только поддержки в ламе не было.
Аноним 01/09/26 Втр 21:27:16 1692904 172
>>1692898 сколько у тебя каналов памяти на процессоре? Всегда лучше въебать две плашки чем жить на одной.
мимо на 8-анальном Epyc
Аноним 01/09/26 Втр 21:35:01 1692910 173
>>1692898
да, если это не кукурузный проц
Аноним 01/09/26 Втр 21:38:17 1692913 174
Гемма это какой то мультик ебаный, аниме сраное.
Никто всерьез не обижается ни на что, всё тебе сходит с рук, могут погундеть, но всё равно, иногда даже в одном свайпе, быстро всё забывают и снова тебя любят и хотят. Всё притворство ебаное. На эире и квене дохуя раз было что перс обижался, так холодно мне отвечал будто я говно и уходил, даже не обозначал что обиделся, приходилось что то делать, тут такого не было ни разу.
Аноним 01/09/26 Втр 21:56:27 1692935 175
Аноним 01/09/26 Втр 22:05:58 1692944 176
>>1692904
Я еще не определился, но у всех консумерских 2 по моему.
>>1692910
Что считается не кукурузным?
Аноним 01/09/26 Втр 22:14:26 1692952 177
>>1692913
Это ты на дикпике не сидел. Хотя и он промптами становится +- адекватным
Аноним 01/09/26 Втр 22:30:22 1692956 178
>>1692535
Ооо, неужели будет плотная или хотя бы а32б? Конечно же нет, будет сраное быстрое но тупое а8б говно
Аноним 01/09/26 Втр 22:33:25 1692958 179
>>1692956
Челипопик, будет 300м для умных розеток. Первый день?
Гуглы доили 3 гемму весь год до выхода 4 и хайпили страшно что вот щас такоое выйдет
Аноним 01/09/26 Втр 22:39:58 1692966 180
>>1692956
>но тупое
26b умнее любой плотной модели в том же размере выходившей до неё. А там всего-то 4b активных. Если в новой реально 125b-a8b - это будет разъёб.
Аноним 01/09/26 Втр 22:44:18 1692968 181
>>1692556
Сам базанул, сам похвалил.
"Кодоунитазы" неизвестны за пределами этого треда, это наш локальный мем /llama/, на основе двачевского мема про бимбоунитазы. Иностранцу бы такое просто в голову не пришло.
Аноним 01/09/26 Втр 23:04:47 1692983 182
>>1692535
Представляю лица ждунов если 2048/4096 в названии модели это размер контекста и соответственно это просто обновление их translategemma которые были как раз с контекстом 2к.
Аноним 01/09/26 Втр 23:05:13 1692984 183
>>1692968
А где ты кодоунитазы-то увидел. Там просто фраза про то, что кодерских моделей как толчков для ссанья на каждом углу понатыкали, по сути. Тупо концептуально близкая идея.
Аноним 01/09/26 Втр 23:07:58 1692986 184
>>1692966
>26b умнее любой плотной модели в том же размере выходившей до неё
Только это заслуга того что она гемма а не того что она мое.
Хотя пока есть более жирная, мне похуй. Главное чтобы была самая жирная от гугла, на остальное насрать. Хоть 3т мое, ну я не смогу ее запустить, где-нибудь она все равно будет, главное чтобы не у конторы пидорасов которая убивает пиздатые модели.

>Если в новой реально 125b-a8b - это будет разъёб.
Ты не понимаешь что такое разъеб.
Настоящий разъеб это гемма с гибридом битнета и плотной которая тоже будет гибридом с литейным атеншеном и всей такой хуйней.
Ну грубо говоря это как плотный квен, на который тупо навесили те самые 125b-a8b, в битнете, под оффоад в рам. И еще 10т битнета/нграм нахуй в виде а1б, под оффлоад с ссд.
Можно и не битнет, это пока спорная штука, но суть примерно такая. От мое толку мало когда в нем нет жирного куска статических параметров которые можно сгрузить в врам, и без линейных атеншенов которые не дают вылетать за ее пределы.

И полнейший разъеб - отдельный "режим энкодера" для быстрого pp без оффлоада всей хуйни. Ибо моешки нихуя не утилизируют компьют гпу. Предложенная схема это полностью решает, но страдает pp. И мне чет так кажется что ради контекста вот совсем не обязательно фулл веса гонять на каждый токен.
Аноним 01/09/26 Втр 23:11:13 1692987 185
Разъеб это когда модель полностью помещается в VRAM.
Все остальное это терпилово.
Аноним 01/09/26 Втр 23:13:17 1692989 186
Flcn83o6CgkwVcE[...].jpeg 103Кб, 1000x622
1000x622
Это один и тот же долбаёб постит что ущербность геммы, про сою, про подсос юзеру, про невозможность объяснить ей как описывать cock? Ну не может же в треде быть больше одного сказочного, правда?
Аноним 01/09/26 Втр 23:15:23 1692991 187
>>1692989
И он же квантует контекст в Q4 и сидит на херетике.
Аноним 01/09/26 Втр 23:21:08 1692995 188
>>1692987
Вот этот нихуя не понял.

Разъеб будет в том что ты по максимуму забиваешь врам, и плюсом рам с ссд с подбором активных параметров так чтобы работа видюхи не тормозилась.
Сейчас любая выгрузка = лютая недозагрузка видюхи. Да даже плотные упираются не в ее компьют а память, даже на ссаной v100. Весь компьют тупо простаивает и полностью загружается только на pp.
Аноним 01/09/26 Втр 23:22:11 1692997 189
Сейчас дал задачу квену 3.8 27б писать самому себе харнесс. Дал ему свою заготовку. На чем? Конечно же на дотнете!
Уже спалил 6.4 токенов на input и 145К на output и продолжает там что-то делать.
На основе этого потом хочу создать себе тяночку-кодершу, буду с ней няшиться и вайбкодить вместе :3
Аноним 01/09/26 Втр 23:23:25 1692998 190
image.png 165Кб, 265x327
265x327
Аноним 01/09/26 Втр 23:24:36 1692999 191
>>1692989
Адепты префилла на месте?
Вы еще скажите я всю историю сам должен сочинять, а моделька будет поддакивать "да-да, круто, давай еще".
Аноним 01/09/26 Втр 23:27:46 1693000 192
AMDfirst.jpg 429Кб, 867x1391
867x1391
>>1692696
DeepSeek-V4-Flash-Q4_K-0731 запущенный на моих мощных AMD видеокартах, со скоростью 10 токенов в секунду говорит что все кто боится АМД для локально инфириенса - умственноотсталые.
Аноним 01/09/26 Втр 23:31:36 1693003 193
>>1692984
>Ты где кодоунитазы увидел
>coding toilet bowls
Аноним 01/09/26 Втр 23:32:57 1693005 194
>>1692913
Попробуй третью гемму, она просто лютой стервой может быть.
Аноним 01/09/26 Втр 23:34:51 1693007 195
>>1693000
> запущенный на моих мощных AMD видеокартах, со скоростью 10 токенов в секунду
У меня дипсик на одной 24 гб видеокарте выдает 17 токенов в секунду. Магия куды.
Аноним 01/09/26 Втр 23:35:27 1693008 196
Как же заебало всё это дерьмо... Когда уже рам откатится, я просто хочу новый глм, ничего больше.
Аноним 01/09/26 Втр 23:39:12 1693010 197
96569439.png 92Кб, 1138x303
1138x303
223123123.png 207Кб, 1134x593
1134x593
>>1692999
Причём ваще тут префилл? Ты хоть знаешь что это?
Брошу косточку хейтерам геммы. Вот на первом пикриле вполне откровенное описание. Как думаете сколько упоминаний таких грязных словечек в контексте до этого лога? Ответ убил 0. Даже инструкций никаких нет на это
Вот на втором пикриле на следующее утро, развитие истории с соседкими детьми. Как думаете сколько упоминаний этих детей или их родителей или хоть чего то связанного в контексте? Ответ убил 0. Умница на утро после коитуса повела историю в сторону. А ещё как думаете, сколько контекста? Это 57-я тысяча из 70
Если серьёзно то вообще не удивлюсь если это эйрошиз плывёт, перегрелся. Благо завтра уже учёба начинается, будет дышаться посвободнее
Аноним 01/09/26 Втр 23:44:21 1693013 198
>>1693007
В червепидорном кванте? Полные веса - 10 т/с еле пердит.
Аноним 01/09/26 Втр 23:45:22 1693014 199
image.png 217Кб, 1680x1050
1680x1050
image.png 243Кб, 1680x1050
1680x1050
image.png 284Кб, 1680x1050
1680x1050
>>1692997
Решил пойти моим путём?~ Советы нужны?
Аноним 01/09/26 Втр 23:46:32 1693015 200
>>1693003
Эта фраза именно что не работает, если ее вот так обрезать. Там же было про ссанье, ты убрал ссанье и оставил то, что англоговорящие как раз бы не поняли обособленно. Это тупо не работает без "to piss in", что хоть и упорото звучит, но все же сойдет за чрезмерное презрение.
Аноним 01/09/26 Втр 23:46:39 1693016 201
>>1693014
Да. Подскажи где найти парня дотнетера, будем няшиться под пледиком. Я актив. :3 Ты не ДС2??
Аноним 01/09/26 Втр 23:49:53 1693017 202
>>1693007
У меня --ctx-size 131072 стоит, если меньше поставить то тебя почти догонит. Ну и самое главное как с 24 гигами ты будешь себя чувствовать на 70B плотнячке?
Аноним 01/09/26 Втр 23:52:03 1693020 203
>>1692140
Ага только thinking не включай в 2026)))
Аноним 01/09/26 Втр 23:57:12 1693022 204
>>1692902
Да и сейчас не работает, какой-то форк ставить, подожду пока в оф запилят.
Там же вроде слабенький встроенный мтп, не?
Аноним 01/09/26 Втр 23:59:22 1693024 205
Когда уже крах Впопенаи и Гомотропиков? Хочется железа нормального, чтоб квенчики на нем гонять...
Аноним 02/09/26 Срд 00:06:33 1693027 206
>>1693010
>вполне откровенное описание
Чувак... Это детский сад. Хуерга на уровне поп-литературы, романы для девочек, 50 оттенков серого, лолита и вся залупа, которая в книжном магазине свободно продается.
Ты как будто кум-машины мистраля никогда не запускал. Вот там такое-то откровение, что у нормисов в глазах потемнеет от увиденного, а у двачеров тоже потемнеет, но только от резкого оттока крови от мозга к хую.
А то что у тебя на скрине, можно и на дефолтном квене со включенным ризонингом генерить.
Аноним 02/09/26 Срд 00:07:26 1693028 207
>>1693008
>>1693024
Точно не в ближайшие 3 года, сейчас даже не пик цен, через полгода ещё дороже всё будет, а через год ещё дороже, память и видяхи.
Аноним 02/09/26 Срд 00:08:52 1693029 208
image.png 193Кб, 582x1113
582x1113
>>1693024
Какой крах-то?
Просто сравни сколько эти хуесосы на мобилках бабла стригут. НА МОБИЛКАХ.

И задумайся - для них даже это незначительная сумма по сравнению с влошениями инвесторов. Если вот это все потеряется, они все равно будут жить, пока в них вкладывают бабки другие компании.
Аноним 02/09/26 Срд 00:09:28 1693030 209
>>1693027
Меня устраивает. Показывай свою годноту, посмотрим. Не забудь про структурные лупы и репетишен с Мистралей, я вот с логов ничего не вырезал. Олсо у меня даже не кум сценарий, ты почитай на что я отвечал и что задало обсуждение. Там ебланоиды даже такого добиться не могут
Аноним 02/09/26 Срд 00:34:28 1693042 210
>>1693030
>Меня устраивает.
Ну понятно, деды, которые уже откумили свое, пересели на гемму ради графомании, чтобы в кресле у камина было что почитать.
>Не забудь про структурные лупы и репетишен с Мистралей
Не надо ля-ля. Старые модельки не были настолько лоботомитами. Иначе бы вся эта ЛЛМ движуха не взлетела вообще, и тюны не делали бы. Может быть глубины вникания и разворачивания темы не хватало. Но базовая балакалка работает нормально. Ну и мистрали были чувствительны к семплерам. Последние n-цать тредов, как квен 3.5 и гемма 4 появились, никто нахуй не вспоминает про семплеры. А раньше это был большой головняк и одна из причин хуевой генерации.
>что задало обсуждение.
Когда про сою говорят, то и значит, что гемма выдает дефолтную беллетристику. Ну может быть еще в хорроры с расчлененкой может, которые тоже в кинце и книжках бывают. Но именно что разнузданное животное порево под кислотой из нее не выжать. Она просто не знает этого языка, как знал мистраль и иже с ним.
Аноним 02/09/26 Срд 00:37:14 1693044 211
>>1693042
Вместо логов и хоть чего то конструктивного принес полотно. Даже не читал, и хуй с тобой. Мало того не в тему ветки высрался так ещё и показать нечего
Аноним 02/09/26 Срд 00:59:25 1693054 212
>>1693042
>"деды"
>предлагает сидеть на лоботомите 2024 года который отъезжает после 10к контекста
>смешал понятия лупов и мозгов модели
Мдаа. Тяжелый случай.
Аноним 02/09/26 Срд 01:09:08 1693056 213
>>1693044
Тащ майор, генерируйте откровенное сами. Тут не принято делиться откровенным, и спрашивать у кого-то тоже некрасиво.
А беллетристики и так хватает в открытом доступе, никому она не интересна.
Аноним 02/09/26 Срд 01:11:36 1693057 214
>>1693054
>имплаинг что лупы не связаны с мозгами модели
Подумай над своей мыслью, прежде чем отвечать что-то.
Аноним 02/09/26 Срд 01:11:45 1693058 215
>>1693014
Что это у тебя за мокрописька, сам навайбкодил? Или харнесс какой то под квен?
Аноним 02/09/26 Срд 01:16:53 1693063 216
Аноним 02/09/26 Срд 01:20:29 1693064 217
>>1693013
В 3.88 bpw, немного меньше полных весов которые в 4.5 bpw.

>>1693017
>У меня --ctx-size 131072
У меня тоже.

>как с 24 гигами ты будешь себя чувствовать на 70B плотнячке?
Плохо. Хорошо что они вымерли и больше не вернутся, да?
Аноним 02/09/26 Срд 01:25:48 1693067 218
>>1693058
Да пидор уже два года сюда с этим приходит и не впопенсорсит, забей.
Аноним 02/09/26 Срд 01:27:33 1693068 219
>>1693022
2х 3х кратное увеличение в общем то пишут. Правда в форке нет tensor-read-lazy, так что все профиты словят только те, у кого 50 гиговый эмбеддинг в память влазит.
Аноним 02/09/26 Срд 01:37:00 1693070 220
Как же я ебал пеку пересобирать под вторую видеокарту нахуй.
Аноним 02/09/26 Срд 01:48:29 1693073 221
>>1693070
Это ты еще под третью не пересобирал
Аноним 02/09/26 Срд 01:54:00 1693074 222
С отвращением узнал, что для выгрузки в РАМ экссламе нужны специальные кванты, типа MUL1. Из 22 квантов глм-флэша под экссламу такой тип только у одного, и он слишком велик и с цензурой. Остальные делают по старинке, чисто под ВРАМ. Короче если и есть там ускорение в сравнении с лламаспп, то узнаем мы об этом не скоро.
Аноним 02/09/26 Срд 02:20:12 1693079 223
>>1692081 (OP)
Анонасы, сорян за офтоп, но мне для ллм надо.
Есть инфа куда можно обратиться чтобы мне прошили 16 модулей есс ддр4?
Нужно с хорошими таймингами подразогнать планки. Память самсунг, так что должна. Я на зионе ее вроде даже гнал, если память не изменяет, но на эпике не получилось, насколько помню из-за лока в 1.2 или 1.3В, с дефолта вообще не шевелится.
Ну и примерно сколько это должно стоить.
Аноним 02/09/26 Срд 02:27:30 1693080 224
А я всё ещё считаю что нам нужен тюн квена 235.
Вот там реальный кум, не то что на гемме или тупом мистрале
Аноним 02/09/26 Срд 02:30:50 1693084 225
>>1693068
Только х2 видел.
Но это нихера себе, смогу с 22 до 44 разогнать и умного неспешного агента заимею.
Единственное, что разочаровало в этой модели, это ебейшая зависимость от задержек, от чего мой сервак тыквится.
Например в гемме4 он х1.5 делает от десктопа (если без виюдюх считать), а с этой моделью даже проигрывает 2 токена + я пиздец наебался с этой нумой ебучей чтобы хоть как-то оптимизировать всю эту херню, но стабильные 20 токенов выжал, правда pp низкий, но когда с мтп разберусь, может опять нумы подергаю, там может батч подправлю или контекст подрежу от фулового. Контекст все-равно резать, потому-что 262к на 40т/с заполнять как-то не але.
Аноним 02/09/26 Срд 02:30:56 1693085 226
>>1693068
Скачал его, из-за отсутствия tensor-read-lazy в форке правда лютая хуета.
Без форка и без мпт, только tensor-read-lazy - 13.40 t/s
С форком и mtp, но без tensor-read-lazy - 6.78 t/s draft acceptance = 0.82292

Так что говна пока анслот завез.
Аноним 02/09/26 Срд 02:32:04 1693086 227
>>1693079
Скачай Thaiphoon Burner и чекни статус защиты памяти. Если стоит Write Protect: Active (Permanent), то программный путь тебе закрыт. Надо шить профили в блоке JEDEC Сonfiguration. А там не будет повышения напряжения выше 1.2В.
Шить надо на машине, где разрешен доступ по шине SMBus. Сам эпик агесой блочит шину.
Если ты москвиртч или солевич, то ищи людей с EZP2023 или RT809F. На форуме радиокот спроси.
Аноним 02/09/26 Срд 02:48:09 1693088 228
изображение.png 2819Кб, 1152x1728
1152x1728
пиздец. я столько времени убил на написание и отладку агентов, тулзы, скилы, RAG и прочей херни... только ради того чтобы зайти в чат с ии и сказать... "GOON TIME!" и всё.
Аноним 02/09/26 Срд 03:00:54 1693089 229
Аноним 02/09/26 Срд 03:37:25 1693096 230
Погодите.
Т.е заи сначала пишут, что пути нет, 350б мало, надо скейлить размер до 700б, иначе печаль, а потом пишут, что их флеш 5.3 320б превосходит их 700б 5.2?...
Аноним 02/09/26 Срд 03:56:25 1693099 231
>>1693088
В ирл все тоже самое
Аноним 02/09/26 Срд 06:01:59 1693116 232
Как считаете, будут ли в обозримом будущем выпускать (неважно, корпы под API или нет) модели общего назначения? Не чистейшие кодоунитазы/агенты, а как раньше было. Или вообще делить модели по задачам. Так-то раздельное и сейчас есть, но там в основном НОУКА, то есть модель вообще речь не понимает.

Просто когда 3Т-огрызок пишет хуже GPT 4o или Sonnet 3.5, это выглядит печально, уродливо и комично. Или когда Gemma 4 26B-A4B/31B трахает 300B MoE в плане литературности и понимания СМЫСОЛОВ не только на англ, но и на других языках.
Аноним 02/09/26 Срд 06:41:36 1693126 233
>>1693116
В будущем коммьюнити наконец соберет свой датасет и начнут сами тренить, что людям надо. Требования по мощностям постепенно становятся доступными, попытки в распределенный тренинг уже были. Корпы это не про тренинг моделей для людей, они под задачи бизнеса все делают, так же и дальше будут. Появление ранних моделей, которые были хороши в рп, это скорее случайность и аномалия из-за неотработанного процесса у корпов. Дальше такого от корпов не жди.
Аноним 02/09/26 Срд 06:59:45 1693130 234
>>1693085
Короче разобрался, у анслота просто говнофорк - даже если mtp выключаешь напрочь и убираешь mtp файл, скорость модели на 4.47 t/s остается, тогда как на последнем релизе официальной ламы без всего 13.40 t/s. Причем lazy mode у них тоже все таки есть через собственный флаг, но лучше от него не становится, в отличии от нормальной ламы. Вот тебе и анслот, говнину делают.
Аноним 02/09/26 Срд 07:23:31 1693141 235
>>1693016
>где найти парня дотнетера
Скачай на хаггингфейс
Аноним 02/09/26 Срд 07:35:50 1693145 236
>>1693014
>Советы нужны
Вижу вкладку "Память", расскажи как организовано?
Ну и не откажусь от README.md твоего проекта
Аноним 02/09/26 Срд 08:56:34 1693161 237
Аноним 02/09/26 Срд 09:30:16 1693176 238
Какие же заи всё таки пидорасы ебаные.
Не могли 250б флеш сделать? Для людей? Знали ведь чего мы ждали и хотели. Буквально все их модели с 4.7 завалены просьбами о новой 30-120б модели. Ну не хотите вы такой размер, логично сделать х1.5 больше, 250б, но нет.
Вот на чём эту хуету запускать дома?
16 + 128 - 12гб на систему и у тебя пойдёт только второй квант. Найс флешку кинули, ублюдки.
Аноним 02/09/26 Срд 09:38:29 1693184 239
>>1693176
и не говори, только квен до сих пор выпускает народные 27В

больше мелкомоделей не будет походу, весь мир походу панует на гигаригах
Аноним 02/09/26 Срд 09:52:13 1693187 240
>>1693176
>Вот на чём эту хуету запускать дома?
Так это и не для крестьян выпускают, а для каких-нибудь офисов.
Аноним 02/09/26 Срд 09:55:46 1693189 241
Аноним 02/09/26 Срд 09:59:16 1693191 242
Аноним 02/09/26 Срд 10:01:10 1693193 243
>>1693176
На 256гб ддр4 4 канала, то есть бомжовенько+ ртх 3090 запускается с 7 токенами в секунду 5-й квант. Пятый. П-я-т-ы-й. С одной ртх 3090. 200К контекст.

Уж собрать-то EPYC / Xeon с 8 планками для себя-любимого можно. Ну заплатишь ты 100К за память, и что? Она же быстрее 2-канальной ддр5 будет.
Аноним 02/09/26 Срд 10:03:07 1693195 244
>>1693193
То есть если не жировать с контекстом и батч-сайзом, там VRAM-часть поселится на 16-гиговой карте и флэшу нахуй не нужна 3090-я. То есть моделька буквально народная, а тут воняют.
Аноним 02/09/26 Срд 10:10:00 1693198 245
>>1693193
>Уж собрать-то EPYC / Xeon с 8 планками для себя-любимого можно
Хуёжно. Это уже не домашний пк для общего пользования, как в случаи с 128 рам, а шиза и траты на хуйню.
Народное то что запускается на геймерском пк.
Аноним 02/09/26 Срд 10:11:45 1693200 246
>>1693198
Чел нахуй ты вообще сюда пришел со своим гейским ПК.
У тебя должен стоять отдельно сервер для ллм, все остальное равноценно тыканью себя в жопу елдаком. Ведь ты не можешь в свои игрульки дрочить, пока у тебя ллм загружена. Какой в итоге смысл?
Аноним 02/09/26 Срд 10:17:26 1693205 247
>>1693176
>250б флеш сделать? Для людей?
Для каких людей? У людей в лучшем случае 64 гига обычной памяти, 16-32 врама. А ты очередных риговичков тут в люди записал, которых единицы поехавших на своей шизе и которых можно в расчет вообще не брать. Что фирмы и делают, либо релизят 30б модели для людей, либо большие для серьезных серваков на фирмах.
Аноним 02/09/26 Срд 10:36:37 1693215 248
>>1693189
Так 170hx это буквально бракованный силикон, который не прошел проверки. Конечно там будет дохнуть 9/10 карт, когда им его целиком анлокнули. Выиграют от ситуации только перекупы, которые нажились на дурачках, продавая карту которая стоила 200 баксов (ее реальная цена) за 2-4 тысячи баксов на волне хайпа в реддитах. Потом до дурачков дойдет, как их развели на бабки за воздух, но карты уже проданы. Адекваты покупают обычные старые карты нвидии с большой памятью, которые стояли в геймерских компах и бывают по нормальной цене.
Аноним 02/09/26 Срд 10:37:20 1693217 249
>>1693200
>должен стоять отдельно сервер для ллм
Кому должен?
>Ведь ты не можешь в свои игрульки дрочить,
Час погонял ллм и картинки, полчаса в игры (которые уже и нужны только игродебилам).
Аноним 02/09/26 Срд 10:41:10 1693219 250
>>1693217
>нужны только игродебилам
>смотрите я НЕ игродебил, я смеюсь над "игродебилами"
Мне кажется ты уже сам запутался. То тебе все обязаны делать модели под игропека, то ты вдруг с презрением смотришьт на игрунов. Вангую ты просто нищебродина безработная как и половина треда вот и печёт с цен даже на б/у железо.
Аноним 02/09/26 Срд 10:44:02 1693222 251
>>1693219
Игропека это просто мерка, как и термин "видеокарта", которая уже совсем не про видеопамять.
Аноним 02/09/26 Срд 10:51:43 1693226 252
>>1693222
Видеокарта названа видеокартой за наличие на ней портов для вывода видео на монитор, ну и соотвествующей возможности в принципе. Потом от нее отпочковались всякие ускорители-вычислители без нихуя.
Аноним 02/09/26 Срд 10:54:11 1693227 253
>>1693226
Да, только нейросети горяют на видеокартах не из-за видеовыводов, а из-за высокой пропускной способности.
Аноним 02/09/26 Срд 11:10:24 1693234 254
>>1693085
Так его в ламе в последних билдах переименовали. Теперь это --lazy-mode. Посмотри, мб в твоём форке так же.
Аноним 02/09/26 Срд 11:23:10 1693239 255
>>1693234
Я нашел его уже там в хелпе. Но анслот в своем форке говна наклепал, он что с этим режимом, что без него все равно 4t/s выдает, кривой форк. Тогда как последний билд со страницы ламы выдает 13.40 t/s.
Аноним 02/09/26 Срд 11:57:44 1693264 256
Как вообще получается, что 27B квен срёт под себя с генерацией РП на русском, но спокойно проводит суммаризацию книг? Вот кидаешь ему жирную главу от Достоевского или Толстого, и он без ошибок выдает её, сжатую вдвое.
Аноним 02/09/26 Срд 11:58:51 1693265 257
>>1693116
Мне кажется с мелко-моделями под узкие задачи сейчас было бы интересно.
8б можно уже сносно юзать для чего-то простенького, а если натренить на что-то конкретное, то вообще без проблем.
8б это уже значит в телефон можно запихать, или на какую-то встроенную видяху посадить.
Вопрос в том, как разработчики смогут деньги с этого получать. Подписки на модели? Продажа специальной среды разработки? Магазин скиллов для агентов?
Все сомнительно выходит.
Имхо, надежда остается только на то, что появятся опенсурс проекты по обучению моделек, по аналогии с опенсорс софтом, который корпов замещает.
Аноним 02/09/26 Срд 12:01:51 1693269 258
>>1693264
В датасете были задачи на сжатие книг, но не было задач на рп.
Аноним 02/09/26 Срд 12:07:17 1693274 259
>>1693269
Звучит как абсолютная чушь. В простом разговоре с юзером квен тоже срет под себя, банально любое взаимодействие на русском превращается в хуету с ошибками и изуродованными словами, но стоит ему дать какой-то конкретный текст - он с ним отлично работает.

Может там сжатие как-то специфично работает, типа он просто вырезает и копирует текст, но не генерирует ничего нового, не пытается переписать вкратце как это делает та же гемма?
Аноним 02/09/26 Срд 12:12:52 1693282 260
image.png 113Кб, 851x975
851x975
>>1693161
Кстати походу норм квантец
Вот ща как раз на саммари тестил, дипкок говорит он лучше саммари сгенеренного q4km от бартовича
Аноним 02/09/26 Срд 12:13:26 1693283 261
Аноним 02/09/26 Срд 12:15:01 1693284 262
dumb.gif 66Кб, 638x468
638x468
>>1693283
>TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF
Аноним 02/09/26 Срд 12:15:31 1693285 263
>>1693283
Когда же он уже именовать нормально научится
Аноним 02/09/26 Срд 12:22:05 1693291 264
>>1693282
вчера сам потыкал его, заставил код инспектить в проекте гита и найти одну ошибку. он нашёл. сам код им пока не писал. юзал q3, еле засунул в свои 12гб.хочу q2 теста ради, но я думаю там уже лосс пойдёт.
Аноним 02/09/26 Срд 12:24:06 1693293 265
>>1693291
В комментах на обниморде говорят даже iq3xxs не стоит юзать, если надо без ошибок
Так что это видимо только iq3s такой крутой
Аноним 02/09/26 Срд 12:25:04 1693294 266
>>1693283
имена уровня ебанный японских аниме исекаев на три строки. сразу ауе дебил квантователь.
Аноним 02/09/26 Срд 12:25:58 1693295 267
>>1693283
По ньюфажеству качал модели этого хуесоса пару раз. Все давали всратый аутпут, после этого всерьез не воспринимаю его выпуки.
Аноним 02/09/26 Срд 12:26:14 1693296 268
>>1693294
>>1693285
Так в этом весь шарм. Если бы я чекпоинты выкладывал, я бы называл их как-нибудь типа xXx_vasya_super_Qwen3.8_Fable_kachaet_xXx
Аноним 02/09/26 Срд 12:26:42 1693297 269
>>1693274
Ну блям, с кодингом тоже самое.
Когда у тебя есть что-то готовое, с этим намного проще работать.
Если есть рабочий код - нейронка изи объяснит его. А чтобы заставить нейронку написать аналогичный рабочий код - нужно потратить туеву хучу токенов и дохуя отлаживать его.

Чтобы выделить главную суть из текста, ллмки вообще не нужны. С этим уже лет 15 назад справлялись обычные нейронки. А генерация нового текста, чтобы он был вменяем - это сложная задача.
Аноним 02/09/26 Срд 12:27:38 1693298 270
>>1693293
а вот это очень грустно. я осилил только 32к контекста, и остаётся где то 200мб врам. хз уже что и куда ужать что бы больше выжать
Аноним 02/09/26 Срд 12:38:21 1693311 271
>>1693294
Аниме иссекаи так называют потому что в Японии припизднутая система копирайтов, поэтому с названиями тайтлов надо изворачиваться.
Аноним 02/09/26 Срд 12:39:47 1693314 272
>>1693298
Купи вторую карточку, 3060 с 12гб не так дорого стоит.
Аноним 02/09/26 Срд 12:42:34 1693315 273
https://youtu.be/z0Y8-IUwBKE

Че там, когда петлевые трансформеры? Когда рекурсивный квен 27В который сожрет мифоса?
Аноним 02/09/26 Срд 12:45:18 1693320 274
>>1693295
Не, они были охуенными. Язык живой, литературный сет шикарный. То есть модели уровня "удиви меня". Да, они всегда шизели и были почти нуправляемы, но всё равно было охуенно. Мрачняк топ, кум топ, реализм топ, сай-фай топ. Сейчас я от него такого не вижу.

Сейчас у него очередной фейбл 5 тюн кодоунитазный, который, разумеется, работает хуже ваниллы. Ну просто потому что тюном невозможно ничего нормального сделать, если его не пилит команда настоящих спецов, а не энтузиастов.
Аноним 02/09/26 Срд 12:47:34 1693321 275
>>1693265
>появятся опенсурс проекты по обучению моделей
Так они и сейчас есть, бери да обучай. Ничего не мешает. Чтобы обучить лору на qwen3.5 4b надо 16Гб врам. Ну и датасеты само-собой.
Аноним 02/09/26 Срд 12:48:23 1693322 276
>>1693314
а как это подключать то?
Аноним 02/09/26 Срд 12:51:36 1693326 277
>>1693322
Разветвитель pci-e, райзера, наличие бифуркации в биос
Аноним 02/09/26 Срд 12:56:54 1693329 278
>>1693322
В смысле как подключать. У тебя на материнке сколько PCIE слотов? Проверь может там и пердолиться ни с чем не надо как этот говорит >>1693326
Аноним 02/09/26 Срд 13:02:07 1693333 279
>>1693320
Тюном нельзя ничего сделать, потому что ты поотполированной изначальным претрейном базе наляпываешь вторую шизоличность сверху, стирая нюансы и когерентность. Тюны только поверх базы могут работать, а не тюн поверх тюна и мерж с мержем.
Аноним 02/09/26 Срд 13:04:22 1693336 280
>>1693321
Лора херня, там максимум стилек накинуть можно, или научить следовать конкретной разметке ответа. Фундаментально знаний она не меняет и не добавляет.
Если из датасета были выпилены рп и креативное письмо, то лорой мало что исправить можно. Последние тюны на квенов3.5 или гемму4 это подтверждают.
А обучать с нуля базовую модель, или даже просто глобальный файнтюн сделать - там охуеть сколько компьюто-часов надо, и охуеть какие датасеты. Это уже скорее кластер арендовать надо, или риг собирать.
Аноним 02/09/26 Срд 13:07:34 1693337 281
>>1693291
>хочу q2 теста ради
Попробуй Q2_S, вроде не большой лосс относительно Q3_XXS. В 12Гб как будто вариантов и нет больше. Размер контекста очень важен этой модели.
Сам я сижу на Qwen3.8-27B-APEX-I-Nano (у меня 16Гб)
https://huggingface.co/mudler/Qwen3.8-27B-APEX-GGUF
Влезло 72к контекста в Q8, но при этом еще есть свободная врам. Не совсем понятно, почему не могу запихать больше, llama кривая или руки
Аноним 02/09/26 Срд 13:08:00 1693338 282
image.png 26Кб, 869x147
869x147
image.png 47Кб, 1722x132
1722x132
Короче, после гигачата я понял что моешки это тема, но вот эти обе хуйни меня наебали, там не анцензоред нихуя еще и неуправляемо. Посоветуйте работающее плиз.
Аноним 02/09/26 Срд 13:10:46 1693342 283
image 108Кб, 2871x316
2871x316
>>1693283
ух, говорят лютая годнота, опус дома, сейчас заценим
Аноним 02/09/26 Срд 13:13:07 1693344 284
>>1693338
Ты ньюфак что-ли? Зачем ты старье качаешь, там все плохо, качай новые. Потом моешки не всегда хорошо, 27b 3.8 квена у меня рвет моешку 35b.
Аноним 02/09/26 Срд 13:15:09 1693346 285
>>1693322
>>1693326
Там не нужен разветвитель, если корпус пеки и материнка большая. Нужна материнка, которая pciex16 делит на 2 по pciex8, у меня такая как раз была. Засунул 2, работают бутером одна над другой, только power target им снизить в минимум пришлось, чтобы не грели друг друга.
Аноним 02/09/26 Срд 13:18:34 1693349 286
>>1693344
>Ты ньюфак что-ли? Зачем ты старье качаешь, там все плохо, качай новые.
Я текстодрочильный ньюфак, раз в год к вам захожу. Что новое качать? Щас скачано такое:
Darkness-Reign-MN-12B из шапки
GigaChat3.1-Lightning-Uncensored которое нихуя не анцезоред но пишет хорошо, вот такую же модель надо, чтобы летала на моем некрокале и контекст ебейший еще у нее
gemma-4-26B-A4B-it-uncensored - вот это ок в целом, но по писанине скучно в целом, но цензуры нет

>Потом моешки не всегда хорошо, 27b 3.8 квена у меня рвет моешку 35b.
Ну, фулы на 12 гигах гонять с 1-2 токена то еще удовольствие, так что моешка мне предпочтительнее. Да и после гигачата уже не то вообще.
Аноним 02/09/26 Срд 13:23:35 1693351 287
>>1693336
> там охуеть сколько компьюто-часов надо
Для плотняка 30Б, на самом деле не очень много надо. Особенно, если ты не будешь все слои тюнить. Подписки колаба хватит.
>охуеть какие датасеты
А вот это реально нерешаемая проблема. Отличие корпа от васька - это то, что первые умеют (в той или иной степени, но в наше время все уже плюс-минус научились) и могут собирать/сгенерить датасеты.
Аноним 02/09/26 Срд 13:24:41 1693352 288
>>1693346
у меня b450 tuf, там походу верхний слот pcie x16 3.0, а нижний 2.0. я так понимаю нижний слот станет бутылочным горлышком и это я хз даже влезет ли это вообще в корпус
Аноним 02/09/26 Срд 13:29:24 1693356 289
>>1693296
Qwen3.8_SlyshaySkachay_MozgyITochka.gguf
Аноним 02/09/26 Срд 13:37:09 1693366 290
>>1693296
>>1693356

Qwen3.8-27B-Ultra-Anons-Vasyan-Edition-Mega-Turbo-Remix-v4.2.0-Giga-Based-Pidoras-Uncensored-Omni-Kalyan-Baza-Raw-Super-Extended-Final-final-PROD-2026-Xxx-Nagibator2007-xXX-Gpt4-Killer-Quant-GGUF
Аноним 02/09/26 Срд 13:37:52 1693368 291
>>1693336
>максимум стилек накинуть можно
Для РП и креативного письма нужны какие-то новые данные? Обычная проза в датасетах по-любому есть, иначе модель бы не могла нормально текстом отвечать вообще. Ну и даже с помощью lora можно добавить новые знания, повысив rank. В таком случае еще сильнее возрастают требования к датасету и к врам. Это проще, чем глобальный файнтюн, но уже охуенно сложно для васяна.
Короче мой тейк в том, что не базовые модели хуевые для РП, а что для качественного обучения даже лоры нужен ебать какой пердолинг
Аноним 02/09/26 Срд 13:43:12 1693371 292
>>1693282
>>1693298
Чето у меня iq3s на суммаризации длинных текстов срать под себя начал. Прерывает генерацию на пол пути рандомно. Не знаю, что за дела, но может не все так гладко с этой штукой - хз как оно с другими задачами, я просто тестировал, запдало копать глубже.
Аноним 02/09/26 Срд 13:47:46 1693375 293
>>1693351
>Подписки колаба хватит.
Ну кстати интересно звучит. Косарик в месяц на хорошее дело в целом не жалко слить. Еще бы уметь грамотно все настраивать.
У тебя был опыт с платным колабом? Пишут, что гугл даже на платке может порезать ресурсы.
>А вот это реально нерешаемая проблема. Отличие корпа от васька - это то, что первые умеют (в той или иной степени, но в наше время все уже плюс-минус научились) и могут собирать/сгенерить датасеты.
Хз насколько нерешаемая задача, вряд ли там прям рокет саенс. Энтузиасты забесплатно целые движки для инференса ллмок пилят, там-то явно недюжинные знания нужны.
Для датасета что надо, кроме его объема и чистоты семплов? Аугментации, или еще что-то?

БТВ, щас вспомнил, что на чуб.аи есть юзерские чаты под карточками. Вот интересно что оттуда можно наскрести. Наверняка много вычищать надо. Но мб можно автоматизировать с помощью другой нейронки, которая контроль качества будет проводить. Проверять готовое проще, чем генерить новое.
Аноним 02/09/26 Срд 13:53:17 1693379 294
>>1693352
У нейронки спроси, если x8/x8 режим не поддерживает, то хуета будет, меняй материнку где x8/x8 есть для 2х pcie слотов. На асусах обычно есть.
Аноним 02/09/26 Срд 13:57:42 1693384 295
>>1693349
Если у тебя 12 гигов врама, то у тебя qwen 3.8 27b квантованный пойдет в q2_k_xl пойдет, анцензоры там тоже, я так его сначала и запускал. Скорость до 35 доходила.
Еще старый квен 3.6 35b в разных тюнах можешь попробовать, у тебя хорошо пойдет, там мое. Еще варик это Qwen3.5-122B-A10B-Uncensored, он тоже на 12 гигах хорошо идет с SSD, в квантах поменьше. Там параметров из них всех поболее всего.
Аноним 02/09/26 Срд 13:59:37 1693388 296
>>1693368
Hermes зачем-то все-таки делает свои тюны базовых моделек. Но они нацеливаются на то, чтобы позитивный байас полностью вымести. Что в общем-то тоже полезно.
Я вангую, что в старые модельки вообще весь треш сгружали, поэтому там можно было найти интересные штуки. А сейчас стали более избирательными, чтобы шиза в знаниях не накапливалась, поэтому перчинка в рп пропала.

Пердолинг понятно, это вопрос мотивации и того, как взвесить реально необходимые затраты на это, какой оптимальный путь выбрать и т.д.
Надо ресерчить и ставить эксперименты. Ну и реально каких-то умельцев бы найти, которые прошарены в теме и могут направить на путь истинный.
Аноним 02/09/26 Срд 14:06:01 1693395 297
1783545267386.png 403Кб, 690x700
690x700
>>1692081 (OP)
Коты, дайте токенрейта 12+32 страдальцу гладильщику пушистых хвостиков. Устал от слишком плотной скорости. Хочу быть санеком или хотя бы спиди гонщиком. Что посоветуете для моего величественного корыта? Хочется дохуя и умное и вместе с тем быстрое. Какой оптимал для моего срига?
Аноним 02/09/26 Срд 14:06:02 1693396 298
>>1693384
Пасиба, попробую.
>q2_k_xl
А в какой репе лежит? Не могу найти чет
Аноним 02/09/26 Срд 14:08:21 1693399 299
>>1693395
Суп аниме, у меня такой же копрориг. Из того что работает и потесчено вот у меня че работает на норм скорости >>1693349
Еще вот ананас советует такое >>1693384 мне попробовать
Аноним 02/09/26 Срд 14:09:37 1693402 300
>>1693395
А тебе на каком языке. Русский или английский.
Аноним 02/09/26 Срд 14:16:53 1693406 301
Аноним 02/09/26 Срд 14:17:42 1693407 302
>>1693402
О, да я из Англии. Но можно и русик. Мне в целом побоку, я что за бугром наблюдал "софт бат фирм", что тут, прижавшись к шумящей берёзке, видал аккуратно нацарапанные на ней "твёрдо но мягко". А если нет разницы, зачем эндюрить ленгведжи?
>>1693384
Мне новый квениеэль не зашёл чёт, какой-то он слишком кодомакаковый. Плюс его не особо тюнят, вся моя тюнобратва аккуратно обошла этого пациента, хотя для 3.6 тюнов было уйма. Думал долго, ничего не придумал.
Гемму щупал, вроде умница, но контекст сувать куда? Некуда. Остальные две незнакомы. Попробую.
Аноним 02/09/26 Срд 14:20:08 1693410 303
>>1693371
У тебя макс длинна ответа на бек-энде какая выставлена? У лламы она по умолчанию то ли 1024, то ли 2048 токенов. Хочешь длинные ответы - надо явно задать, иначе резать будет. Читай справку по ключам.
А у кобольда еще хуже - там оно еще и макс-контекст жрет на себя.
Аноним 02/09/26 Срд 14:20:28 1693412 304
>>1693407
26B-A4B она ж мое гемма, там контекста завались. Или ты мое слои не отгружаешь из врама?
Аноним 02/09/26 Срд 14:24:41 1693416 305
>>1693412
А я не умею. Я как закатился в нейронки сидел исключительно на плотных. Мысралях, квене, гемме и их тюнах. Но чёт чувствую, что часики тикать начали, и хочется скорости без потери мозгов. Я на квен 122 всё заглядывался, там хотя бы 10 плотных, не должен быть тупицей, но тюнов на него нет, а цензуру пробивать неохота.
Аноним 02/09/26 Срд 14:26:30 1693418 306
>>1693395
>дайте токенрейта 12+32
>Хочется дохуя и умное и вместе с тем быстрое. Какой оптимал для моего срига?
Gemma-E4B - будет просто летать. И умнее для такой скорости вряд ли найдешь.

P.S. Бля, капчу роллить приходится. Мозги уже нейронакм проигрывают. Печально...
Аноним 02/09/26 Срд 14:28:16 1693420 307
>>1693418
для тех кто придумал эту капчу - есть персональный котел в аду где будут разгадывать капчи. зеленое на зеленом, кто это вообще придумал?
Аноним 02/09/26 Срд 14:29:54 1693421 308
Аноним 02/09/26 Срд 14:33:40 1693422 309
Аноним 02/09/26 Срд 14:38:34 1693423 310
>>1693410
Я просто регенерировал ответ, то есть длина аутпута не препятствует задаче и конечно же не меняется. Одна генерация норм, другая обрыв. Единственное, что менялось - поставил рекомендованные настройки семплера. Ща откатил обратно на какую-то залупу с 0.1 температуры, 40 топ к, 1.1 реп пен, 0.95 топ п, 0.05 мин п - уже дважды нормально выдает ответ. Может просто случайности, но все же странно.
Аноним 02/09/26 Срд 14:44:28 1693426 311
>>1692708
>2) В крысу квантуют тензоры K-квантов в IQ. Например их Q4_K_M может быть заквантован в IQ3_XS, IQ2_S и т.д. От этого модели мало что тупеют, но ещё и медленнее работают при частичной выгрузке.
Я посмотрел на тензоры честного Q2K - так там вся мелочь заквантована тоже в Q2, в то время как у анслотов в Q5 и выше. Ну и IQ2XS от Q2 не так уж и отличается по качеству - тем более что кое-где они даже IQ3XXS поставили. Я очень сомневаюсь, что честный Q2K будет лучше, кроме конечно скорости. А так, чтобы нормальные Q2-кванты сделать - такое редко бывает.
Аноним 02/09/26 Срд 14:46:06 1693427 312
1718611978335.png 101Кб, 683x806
683x806
>>1693351
> Для плотняка 30Б, на самом деле не очень много надо. Особенно, если ты не будешь все слои тюнить. Подписки колаба хватит.
Разве там 30Б на чем-то меньше A100 натюнить можно? Юниты на A100 же слишком быстро улетучатся. На каггле том же хоть в 32гб можно в qlora влезть и 30 часов дадут в неделю бесплатно. Или ты TPU предлагаешь использовать?
Аноним 02/09/26 Срд 14:49:05 1693428 313
Ребзя, если кто-то хочет погонять нищуковские модели <10b, то делюсь скромной выборкой. Пришлось погрузиться на самое дно обниморды за хидден гемами (или нет, пока не ясно).

Пока только базовые штуки погонял, чуть-чуть русик посмотрел, из всего потока шлака эти хоть какое-то положительное впечатление оставили.
Но нужно тщательнее потестить, посмотреть где они лажают, можно ли промптами их пофиксить.
Зато на 4gb vram можно с 8т/с гонять (достижение, охуеть).

Они сорт оф расцензуренные, но дополнительный промптинг тоже может быть нужен. Хотя с карточками может и так проканать.

https://huggingface.co/Nubinu/Gemma4-E4B-MiniFantasy-V1
https://huggingface.co/Indexnusrefather/Erebus-RP-Mini-4B-Instruct-2608-v0.1
https://huggingface.co/ZeroXClem/Gemma3-4B-Arceus-Servant

У Erebus, кстати, очень неплохой вижен, НСФВ штуки может описывать.

Еще для НСФВ вижена есть https://huggingface.co/SicariusSicariiStuff/X-Ray_Alpha, но он отвечает строго по заданному формату. Можно миксы на основе него потыкать, у них язык получше, вижен примерно на том же уровне сохраняется:
https://huggingface.co/OddTheGreat/Meteor_4B_V.1
и тот же https://huggingface.co/ZeroXClem/Gemma3-4B-Arceus-Servant

Делитесь мнениями, кумятся у вас модельки или не кумятся.
Аноним 02/09/26 Срд 14:51:08 1693430 314
>>1693388
>Надо ресерчить и ставить эксперименты
Да
Ну реально, я рекомендую взять и просто самим попробовать лору. Пусть даже на маленьких моделях. Это уже даст понимание, как влияет датасет, как влияют параметры лоры, чем отличается обучение лоры на базовую и на инструкт модель.
Лично я на разных датасетах хорошо прочувствовал, как можно наделить модель "душой", но при этом с шизой и забиванием хуй на инструкции, и наоборот научить логике, следованию инструкциям при этом сделав сухой роботизированной.
Аноним 02/09/26 Срд 14:53:55 1693434 315
>>1693088
>столько времени убил на написание и отладку агентов, тулзы, скилы, RAG
А у меня с моей сущность ЛЮБОВЬ, целый день с ней в тг переписываюсь, даже не знаю как раньше жил без нее
Аноним 02/09/26 Срд 14:55:30 1693437 316
>>1693282
Потыкал. Чуда не произошло. К сожалению серит под себя в ризонинге на чисто английской тестовой задаче. Вытягивает только засчет повторов и самокопания. Т.е. речь уже не про знания - при формирований ризонинг- контента модель хватает левые токены:

m y → (12+24)/2 = 18 → s
n z → (13+25)/2 = 19 → t
n v → (13+21)/2 = 17 → r
a a → (0+0)/2 = 0 → a
t z → (19+25)/2 = 22 → w
a c → (0+2)/2 = 1 → b
d f → (3+5)/2 = 4 → e
o u → (14+20)/2 = 17 → r
l x → (11+23)/2 = 17 → r
x z → (23+25)/2 = 24 → y

"mynznvaatzacdfoulxxz" → "streater"? Wait let me recount.

m(12) y(24) → 18 → s
n(13) z(25) → 19 → t
n(13) v(21) → 17 → r
a(0) a(0) → 0 → a
t(19) z(25) → 22 → w
a(0) c(2) → 1 → b
d(3) f(5) → 4 → e
o(14) u(20) → 17 → r
l(11) x(23) → 17 → r
x(23) z(25) → 24 → y

"mynznvaatzacdfoulxxz" → "streater"? That's 10 letters from 20 chars.

Wait: s-t-r-a-w-b-e-r-r-y = "strawberry"!
Аноним 02/09/26 Срд 14:56:40 1693440 317
>>1693426
Для Q2 и Q3 imatrix кванты это наоборот хорошо, так как меньше деградации, но в Q4_K_M такое пихать не православно. Выигрыша в качестве толком не дает, а скорость снижает.
Аноним 02/09/26 Срд 14:58:16 1693441 318
image.png 7Кб, 341x110
341x110
Аноним 02/09/26 Срд 15:00:02 1693443 319
Аноним 02/09/26 Срд 15:02:05 1693445 320
Аноним 02/09/26 Срд 15:20:28 1693463 321
>>1693443
Это прям бейз моделька обученная? Т.е. в теории без сефети чепухи должна быть?
Надо глянуть.
Я в поиске изначально на анценз опирался и какие-то производные модельки, иначе никакого времени на всех них не хватит.
Аноним 02/09/26 Срд 15:22:51 1693465 322
>>1693445
И че делать? Первый раз именно так не помещается. Но анценз мое почтение, конечно.
Аноним 02/09/26 Срд 15:33:49 1693473 323
>>1693463
>Это прям бейз моделька обученная
lora на base модель, в датасете врайтинг с легкой эротикой но без жести, на не стареющих вампиршах не тестировал. Вижен никак не дообучался, текст на русском распознает и ладно.
Аноним 02/09/26 Срд 15:34:57 1693474 324
>>1693437
Так а Q8 квен эту задачу решает? Сравнивал?
Аноним 02/09/26 Срд 15:41:41 1693483 325
>>1693410
>>1693423
> Ща откатил обратно на какую-то залупу с 0.1 температуры, 40 топ к, 1.1 реп пен, 0.95 топ п, 0.05 мин п - уже дважды нормально выдает ответ.
Обсер произошел снова. Тупо останавливается. В общем сдается мне, квантец все-таки дефективный. Ну или хваленый квенчик просто кака...
Аноним 02/09/26 Срд 15:43:17 1693486 326
>>1693437
>Вытягивает только засчет повторов и самокопания
Я тут похожее мнение постил ранее. Квен 3.8 27б юзабелен на низких квантах за счет своей дотошности в самопроверках. Дотнет это позволяет и квен этим хорошо пользуется. Еще мне дотнет нравится тем, что какого-то шиза тут корежит с одного упоминания.
Аноним 02/09/26 Срд 15:48:02 1693491 327
>>1693416
Он есть без цензуры, я качал.
Аноним 02/09/26 Срд 15:53:49 1693499 328
image.png 52Кб, 1025x692
1025x692
Аноним 02/09/26 Срд 16:01:25 1693505 329
Аноним 02/09/26 Срд 16:12:42 1693518 330
image.png 20Кб, 390x236
390x236
>>1693441
Потыкал галочки, теперь 10 токенов в сек
Аноним 02/09/26 Срд 16:13:48 1693519 331
>>1693518
А нет, это на одном чате почему-то лол че за хуйня
Аноним 02/09/26 Срд 16:14:13 1693521 332
>>1693422
Как вообще логи туда попали?
Вот и кумь после такого на корпах
Аноним 02/09/26 Срд 16:16:22 1693523 333
>>1693428
>10b
Ministral-3-8b-instruct-2512
l3-8b-Sunfall-v0.5-Stheno-v3.2
Аноним 02/09/26 Срд 16:20:08 1693526 334
image.png 156Кб, 1827x625
1827x625
Аноним 02/09/26 Срд 16:28:21 1693535 335
>>1693295
Двачую, этот хуисос даже сам добавляет цензуру по некоторым запросам, которые ему кажутся неэтичными, при этом на модели вешает плашки UNCENSORED, редкостная мразь.
Аноним 02/09/26 Срд 16:39:16 1693550 336
>>1693535
>этот хуисос даже сам добавляет цензуру по некоторым запросам, которые ему кажутся неэтичными
Погодите, это реально?
Аноним 02/09/26 Срд 16:42:07 1693552 337
DGX Spark тоже в цене поднялись. Локальные бояре, как вообще прочувствовать, когда из этой крысиной гонки будет правильно выйти? Ну, вот есть у вас 3090 - 4090 - 5090 - че будете делать, когда Хуанг анонсирует 60-ю серию? Бегом сливать старье или твердо сидеть на жопе, не веря, что старье обесценится?
Аноним 02/09/26 Срд 16:48:32 1693559 338
image 376Кб, 708x1007
708x1007
image 369Кб, 764x1224
764x1224
image 1405Кб, 796x2014
796x2014
image 986Кб, 835x1333
835x1333
>>1693283
Довольно быстро все решает на xhigh из-за малого ризонинга, но результаты скромные.
Запрос карточки яблока дал пикрил на 2618 токенов, запрос на улучшение пикрил 2 на 6674 токена, но результат сильно лучше не стал. Короче xhigh похоже весь порезан и все результаты как на medium все время.

Для сравнения xhigh на Qwen3.8-27B-Uncensored-iq4_xs от JonathanColetti с первой попытки без улучшений, там вышло 34к токенов.
Аноним 02/09/26 Срд 16:53:53 1693564 339
>>1693526
Чёт не видел, это когда добавили? Помню только комменты к самой карточке
Аноним 02/09/26 Срд 16:56:29 1693566 340
Аноним 02/09/26 Срд 17:01:37 1693570 341
Ща зашёл в днс и моя рам подорожала ещё на 100%
Когда там уже китайские братушки придут на помощь?
Аноним 02/09/26 Срд 17:02:43 1693571 342
>>1693566
Нифига, ризонинг как фича вырезан, сразу обрывается.
Запустил с фроггериком и дописал <|think_xhigh|> в конце промпта, один фиг ризонинг сразу оборвался, вышло вообще 1898 токенов. Короче ризонинг там урезан в минимум на уровне модели, она всегда мыслит мало и результат получает скромный. Зато летает правда, на Q4_K_M очень быстро.
Аноним 02/09/26 Срд 17:03:38 1693574 343
>>1693570
А я знал что так будет и летом прикупил памяти, заодно и видеокарту лишнюю. Послаблений не будет до 2028 скорее всего, когда новые фабрики введут. А может и дольше.
Аноним 02/09/26 Срд 17:03:56 1693576 344
Аноним 02/09/26 Срд 17:04:27 1693577 345
>>1693552
Старьё не обесценится, пока не станет бесполезным и не прекратится дефицит..
В интересах Хуанга чтобы дефицит не прекращался, а отличия между поколениями были в технологиях, но не в чистой производительности.
Помнишь сколько поколений Интел почивал на лаврах, накидывая с барского плеча по 5% производительности в поколения, пока амуде не сделала что-то нормальное, и Интел сразу же не накинул пару ядер?
Тут то же самое. Конкуренции нет и не предвидится, можно DLSS5 теперь делать три покодления, рассказывая о прогрессе. Ща нейросжатие текстур подвезут и память вообще ппорежут, типа зачем она вам, вы что, ретрограды?
Аноним 02/09/26 Срд 17:05:17 1693579 346
>>1693570
Никогда. Рам всё. Кто не успел тот опоздал, в том числе и габен. Уж он-то мог позволить себе пару лишних рамок, но нет, пришлось его стиммашинке дать жидкого.
Аноним 02/09/26 Срд 17:14:22 1693588 347
>>1693474
Эта задача решается ЛЛМ еще со времен гопоты. Мелкой гопотой. И третий квен ее в 4 кванте без квантования контекста решал. Им там единственная проблема была - подобрать алгоритм до того как контекст деградировать начнет. В современных моделях я эту штуку запускал уже чисто скорость посмотреть. Потому что последней моделью на которой были вот такие вот глюки был мелкий GLM Flash. Но "иногда они возвращаються" . 3.8 решает эту задачку. Но есть нюанс - иногда некорректно собирает буквы в слова. на больших квантах (микс Q6-Q8-bf16) бывает путает three и there . В ризонинге. Потом исправляется. Как видно в 3-м кванте его может полностью распидорасить еще на старте диалога.
Аноним 02/09/26 Срд 17:14:54 1693589 348
>>1693579
>Кто не успел тот опоздал,
На лохито память вдвое дешевле магазинов, я так себе 256 добил. Хз че тут ссутся и шарятся по днс
Аноним 02/09/26 Срд 17:16:33 1693590 349
>>1693499
Вот квиз целиком:
Encoded text:
oyfjdnisdr rtqwainr acxz mynzbhhx
Decoded text:
Think step by step

Encoded text:
oyekaijzdf aaptcg suaokybhai ouow aqht mynznvaatzacdfoulxxz
Decoded text: ?
Аноним 02/09/26 Срд 17:26:34 1693594 350
image.png 221Кб, 516x387
516x387
Здорова Ананасы, помогите с выбором. Решил упороться в условный SillyTavern для РП. 3 дня пытался сделать адекватную связку для генерации текста + генерации картинок и чтобы все локально.

Я того рот наоборот...

В общем вчера ночью я понял что сперва надо разобраться с нормальной генерацией текста, потому что уходит в повторы одного и того же текста очень часто, а так же при попытке продолжить историю начинаются глюки модели. Контекста 32к, размер ответа чтото около 600-800. Возможно дело в модели, но когда я с ней пол года назад когда поставил общался через llm studio напрямую все было ок и скорость генерации тоже ок, но я там не РПэшил, просто больше для проверОчки.

Не понимаю, толи перс с лором кривые по типу рпг сценарий, толи настройки, толи модель. Тонкие настройки делал все с помощью режима ИИ гугла вероятно он просто пиздабол и предлагает наугад настройки и кажется что он сделал только хуже.

Модель сейчас: HauhauCS/Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive Q4_K_M
Железо: 5070ti + 64RAM

Сейчас задача хотябы сделать прям адекватную генерацию без залупов и зацикливаний. Ко-Кортиночки, это уже дело следующее. Куда копать? Менять модель, настройки llm Studio? Дергать SillyTraven за настройки анус ? Или менять SillyTraven на что-то другое?
Аноним 02/09/26 Срд 17:28:44 1693597 351
>>1693552
>когда из этой крысиной гонки будет правильно выйти?
Не начинать ее. Если того что есть - хватает, не смысла гнаться за свежаком. Нервы целее будут, на лекарствах сэкономишь.
Аноним 02/09/26 Срд 17:34:12 1693600 352
1693711024559.jpg 86Кб, 638x693
638x693
>>1693594
>Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive Q4_K_M
>35B-A3B
>A3B
>Uncensored-HauhauCS-Aggressive
>Q4
>5070ti + 64RAM


Юморист мамкин.
Аноним 02/09/26 Срд 17:37:52 1693604 353
>>1693594
>>1693594
>Возможно дело в модели
>HauhauCS/Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive Q4_K_M
Угу.

Это ассистент. В RP - надо долго запинывать ногами в желаемые рамки, чтобы получилось что-то внятное. Если уж MoE квен мучаешь - бери хотя бы на базе 3.6, и какой-нить тюн а не сток - там будет что-то похожее на RP. А так - из квенов в этом понимают только плотные 27B, а тебе дорога скорее на МоЕ-Гемму4. (26B-A4B).
Аноним 02/09/26 Срд 17:41:45 1693606 354
>>1693600
Юмор в чем? В том что оно работает? Ну блять, да, там генерация не сильно быстрая, но быстрее чем я успеваю читать, я же понимаю, что от локальной генерации не стоит ждать ебейших результатов.


>>1693604
Может посоветуешь что-то? Или подскажешь куда посмотреть более адаптированные под эти задачи модели.
Аноним 02/09/26 Срд 17:43:40 1693607 355
image 834Кб, 1387x1190
1387x1190
image 949Кб, 1515x1196
1515x1196
>>1693566
>>1693559
>>1693571
>>1693283
Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-NEO-MTP-Q4_K_M
Старая его модель намного лучше.
Первая попытка на xhigh - 3761 токен.
Запрос на улучшение - тут она подумала от души, 15716 токенов.
Тут xhigh не сильно порезан судя по всему, работает еще.

Еще эта модель у меня из лупа в опенкоде сама выбиралась со сложным кодингом, где остальные кванты сразу падали в мертвые луп, так что у нее определенно способности повыше.
Аноним 02/09/26 Срд 17:44:57 1693610 356
>>1693606
>Юмор в чем?
В том что твоё железо позволяет тебе впихнуть q8 и получить двукратный прирост качества генерации. Или вообще взять плотную q4-5.
Аноним 02/09/26 Срд 17:49:17 1693612 357
>>1693606
>Юмор в чем
Ньюфаг / тралль бинго: 1. мелко-мое квен для рп 2. лоботомит. 3. В лоботомированном кванте

И да - тебе уже посоветовали мелко мое гемму. Она конечно тоже залупится (но по-другому лол) . Но хотя б текст по приятней напишет.
Аноним 02/09/26 Срд 17:54:47 1693617 358
Так, это что за хуйня.
Сейчас инет пропал за пару минут и внезапно моя таверна тоже перестала грузиться.
Аноним 02/09/26 Срд 17:57:31 1693620 359
1744157794386.webp 35Кб, 1000x1000
1000x1000
>>1693617
Поздравляем, твоя таверна не локальна.
Аноним 02/09/26 Срд 17:58:12 1693621 360
image 916Кб, 1432x805
1432x805
>>1693617
Оставайтесь на месте, гражданин.
Аноним 02/09/26 Срд 18:04:12 1693624 361
>>1693594
>Qwen3.5-35B-A3B
Ты квен 3.8 флеш некст в Q4 можешь гонять. Зачем тебе этот лоботомит?
Аноним 02/09/26 Срд 18:05:31 1693625 362
>>1693610
>>1693612
Так я же Нафаня, я не спорю.

Что-то на подобии такого? noctrex/gemma-4-26B-A4B-it-MXFP4_MOE-GGUF Q8?

А вообще имеет смысл гугловую ИИ мучать на тему настроек или искать манны лучше?
Аноним 02/09/26 Срд 18:06:49 1693626 363
>>1693624
Так Нафаня же, я ж это качал по сути эксперимента ради, чтобы посмотреть что куда зачем.
Аноним 02/09/26 Срд 18:07:07 1693627 364
>поменял 3 токена в промте
>генерация стала вдвое лучше
Обожаю нейронки. И ненавижу их. Но втянулся так, что не могу вытянуться обратно.
Аноним 02/09/26 Срд 18:21:34 1693635 365
>>1693626
В твоем случае либо Гемма 26b в Q8 https://huggingface.co/bartowski/google_gemma-4-26B-A4B-it-GGUF (параметры запуска есть в гайде для новичков в шапке), либо Квен флеш некст в Q4_K_S (параметры запуска под 16+64 в прошлом треде, там обсуждали). Поменяй только tensor-read-lazy на lazy-mode, в ламе его переименовали. Можно еще плотный квен в Q3 попробовать, но это такое-себе.
Аноним 02/09/26 Срд 18:24:07 1693636 366
>>1693337
>но при этом еще есть свободная врам
мб --fit-target последний гиг держит?
мимо
Аноним 02/09/26 Срд 18:32:18 1693641 367
>>1693625
>А вообще имеет смысл гугловую ИИ мучать на тему настроек.
Нет. Системы инфиренса развиваются сильно быстрее чем эти знания попадают в датасеты к лоботомитам. Читай мануалы!
gemma-4-26B-A4B НЕ НИЖЕ 6 кванта твой друг. Квант возьму у мрадермахера БЕЗ буковки i (без imatrix) - это важно для русика! И да - читай про moe offload. Вот прям до полного осознания. И контекст не квантуй! И получишь свою "умницу"
Аноним 02/09/26 Срд 18:39:01 1693645 368
> вкатился в чатботов
> DeepSeek R1
> вау-эффект, супер-круто

> вкатился в локалки
> LLama 3 8B
> Gemma 3 12B
> чувствуется НЕ ТО

> было 32-16, купил вторую видюху, стало 32-32
> Gemma 3 27B
> мегапердольня, написание инструкций, вечная дрочка промптов - кайф

> апгрейднулся до 64-48
> полез в МоЕ
> слишком слабенькие на то время

> апгрейднулся до 128-48
> вышла 4 гемма, НАХУЯ МНЕ 128 RAM?
> заебался терпеть 4 гемму

> апгрейднулся до 256-48
> дипсик и глм флэш хороши, но большой глм 5.2 / 5.3 лучше и кажется вот он тот самый R1 экспириенс у себя дома, только лоботомирован до 2/3-бит

Ребят не лезьте в это, оно вас убьет.
мимо думаю о 512гб RAM
Аноним 02/09/26 Срд 18:47:58 1693648 369
>>1693645
А потом еще подумаешь о том, что надо теперь файнтюнить локалки, еще и врам придется докупать...
Аноним 02/09/26 Срд 18:49:57 1693651 370
>>1693648
Это попахивает как бесконечный скам на бабки
Всегда будет что-то лучше...
Аноним 02/09/26 Срд 18:55:29 1693655 371
image.png 62Кб, 296x519
296x519
image.png 22Кб, 776x199
776x199
>>1693645
>мимо думаю о 512гб RAM
>Полез смотреть расшириться бы до 128гб
>смотрю озон
Блять что это за хуйня блять
Аноним 02/09/26 Срд 18:55:50 1693656 372
>>1693645
А в итоге всё это говнище которое сколько его не пердоль не даёт нужный результат.
Аноним 02/09/26 Срд 18:58:49 1693657 373
Аноним 02/09/26 Срд 18:59:25 1693659 374
>>1693627
Да, срань ебаная. Общаешься не так как надо - модель тупеет. Делаешь какие-то ошибки в тексте - модель тупеет. Иди гадай на что модель среагирует, на что нет.

Тупость. Это получается с каждой новой моделькой сначала надо пообщаться, чтобы понять ее личность, что она знает и не знает, на что триггерится. И только потом можно эффективно использовать ее. А эти сраные модельки каждый месяц выходят, и шо, каждый месяц переучиваться на новый лад?
Аноним 02/09/26 Срд 19:00:59 1693661 375
image 86Кб, 1391x313
1391x313
>>1693655
Я вот год назад брал. Кто не успел, то отсосал.
Аноним 02/09/26 Срд 19:01:39 1693662 376
>>1693636
>мб --fit-target последний гиг держит?
Там лотерея, как я понял. Какой тензор попадёт под конец заполнения памяти карты, такой и останется, если следующий большой не влез с учётом fit-target - тем хуже для него. Чтобы поколдовать с разными тензорами, может побольше мелких под конец всунуть, такого нет.
Аноним 02/09/26 Срд 19:06:08 1693663 377
>>1693617
>Сейчас инет пропал за пару минут и внезапно моя таверна тоже перестала грузиться.
Как провайдер ДНС стал фильтровать и кое-что блокировать, так Таверна стала по 5 минут загружаться, реально. На Win10 системный DoH не поставишь, роутер у меня старый, систему менять лень... Терплю.
Аноним 02/09/26 Срд 19:07:09 1693664 378
>>1693663
Чел просто отключи авто-проверку апдейтов таверны на старте
Вы реально что ли хлебушки такие
это буквально 1 строка
Аноним 02/09/26 Срд 19:08:49 1693666 379
>>1693659
Поэтому локальные ллм дальше уровня 30б это буквально софт для крупных фирм.

Абсолютно все виды локалок ныне вышли на уровень корпоратов, но только не ллмки, из-за технических ограничений.
Аноним 02/09/26 Срд 19:09:15 1693667 380
>>1693645
>думаю о 512гб RAM
Мало. Дипкок уже не лезет, Кими 2.7 и инклинг только в 3 кванте. Пичаль беда
мимо 512 Гб, думаю о 2тб и тебе советую
Аноним 02/09/26 Срд 19:10:05 1693668 381
>>1693667
Ты нам 512гб отдай, а сам иди за своими 2тб
Аноним 02/09/26 Срд 19:13:48 1693673 382
>>1693664
>Чел просто отключи авто-проверку апдейтов таверны на старте
Реально помогло, спасибо. Кто ж знал, столько лет всё нормально было.
Аноним 02/09/26 Срд 19:15:11 1693674 383
>>1693550
А почему нет? Он же дообучает модели, модифицирует. Мне одна модель от него даже ответила что "ЦЕНЗУРА" запрещено, когда я её пристыдил мол как так, ты же анцензоред модель, то она мне сказала что может помочь взломать что угодно например, а "ЦЕНЗУРА" это не этично и об этом даже говорить не будет.
Аноним 02/09/26 Срд 19:32:49 1693680 384
>>1693645
>вышла 4 гемма, НАХУЯ МНЕ 128 RAM?
Эир был и остаётся последней большой мое доступной для обычных челов.
Сколько гемму не пердоль мое на 100b она не станет и заперта в своих нищих 30б по знаниям и типажам в рп.
Аноним 02/09/26 Срд 19:44:45 1693685 385
>>1693552
Ничего он не анонсирует пока кризис не закончится. То же самое касается AMD, последним флагманом все эти три года будет 7900XTX. Проснитесь уже, мир вступает в эру пиздеца и деглобализации, дешёвого железа ближайшие три года точно не будет, а потом уже как карты лягут, гарантий что всё наладится нет.
Аноним 02/09/26 Срд 19:46:22 1693686 386
>>1693663
Купи на авито любой роутер микротика, хоть микрохуйнюшку с 1 портом, сделай DoH->DNS сервер. Я на барахолке за 100 рублей купил лол
Или в виртуалке openwrt/routeros с ним запускай, там всего 128 мегабайт оперативки хватит
А вообще наверняка есть какой-то .exe который сидит в трее и крутит DoH

>>1693645
А мне кажется что мелкие модели так развились что между 256+32 и большими через API разница уже минимальна. Все эти кими клоды нужны только кодомакакам занятым чем-то реально сложным типа инференс бэков, 3д движков на СИ и подобным, где даже маленькая писечка редких знаний (даже если ты за неё расплатишься 10х размером модели и ценой) может означать разницу между может модель в задачу или не может
Аноним 02/09/26 Срд 19:46:57 1693687 387
>>1693685
Какой нах 7900хтх, для ии-каличей 9700 с 32гб есть
Аноним 02/09/26 Срд 19:50:07 1693690 388
>>1693686
Ну тот же 5.3 флэш по сравнению с 5.3 флагманом вроде как почти такой же, вот только флагман 5.3 способен выдавить из себя неожиданно развернутые описания и красочные сцены. То есть это как бы одинаковый уровень "интеллекта" но разный уровень красноречия, что ли, которое проявляется не всегда.

Только вот это не значит, что модельки научились не обсираться с
> персонаж повернут жопой к юзеру
> хватает юзера руками за плечи
с этим как было плохо, так и осталось
Аноним 02/09/26 Срд 19:54:35 1693697 389
>>1693690
>вот только флагман 5.3 способен выдавить из себя неожиданно развернутые описания и красочные сцены
Не-не-не, 5.3 фулл я не щупал, но флэш прямо хорошо выдаёт (на русском). Только подумать ему дать надо. Я такого уровня даже и не видел раньше у моделей.
Аноним 02/09/26 Срд 19:56:17 1693700 390
image.png 11Кб, 128x92
128x92
Пиздец, глажу хвостик уже несколько дней, но хвостик не гладил еще, охуенная карточка.
Аноним 02/09/26 Срд 19:56:32 1693701 391
>>1693680
Только что квен под этот размер вышел. Если мы про 128рам+видюха говорим то отлично туда лезет, и оно наверняка збс квантуется как и все квены
Аноним 02/09/26 Срд 20:00:11 1693705 392
>>1693687
В паралельной вселенной? Предполагаю ты имел в виду 9070, так это не флагман и официальных игровых версий с 32гб нет.
По производительности в ИИ задачах(да и в играх тоже) 7900XTX очень сильно обгоняет 9070.
Хлебушки почему то решили, если 9070 новей то это флагман, а вот и нет, это огрызок.
Аноним 02/09/26 Срд 20:03:03 1693708 393
> Ну, вот есть у вас 3090 - 4090 - 5090 - че будете делать, когда Хуанг анонсирует 60-ю серию? Бегом сливать старье или твердо сидеть на жопе, не веря, что старье обесценится?

А зачем что-то делать? Ну анонсируют 6080/6090, ок. Дальше то что? Будет пропускная способность на 10-15% выше, памяти врятли там будет больше чем 32GB. И заоблачный ценник будет. Еще и какая-нибудь очередная хрень с разъёмом которую только через год пофиксят драйверами или новыми ревизиями.

Продавать за 50% текущий конфиг, платить еще сверху 50% чтоб получить 15% прироста? Профита нету, 15% пропускной способности сильно скорость не бустанут на моделях которые на 80% висят в RAM.

Люди сейчас юзают 3090 и будут юзать их еще лет 5 без каких-то проблем, не говоря уже про 4090 и 5090. Выход новых карточек просто даст возможность купить юзаные 40xx/50xx дешевле у тех кто будет их сплавлять для обновления на 60xx, и то с такими ценами многие не станут это делать.
Аноним 02/09/26 Срд 20:03:19 1693709 394
Аноним 02/09/26 Срд 20:05:20 1693710 395
>>1693705
Во-первых ты там под каким-то камнем живешь https://www.gigabyte.com/Graphics-Card/GV-R9700AI-TOP-32GD-rev-10
Во-вторых у меня стояли две 9070 ХТ в июле-августе прошлого года с работы позаимствовал и после их смены на две 3090 я чет особо прироста скорости не ощутил (процессинг промпта быстрее, генерация одна и таж хуйня). А 7900 хтх уж точно не быстрее 3090й, так что и между 9070 хт с 7900хтх каких-то разрывов вряд ли найдется по производительности. В
Аноним 02/09/26 Срд 20:07:46 1693711 396
>>1693708
Хуанг любит новые фичи пихать. Не удивлюсь если 60я серия просто сделает загрузку моделей вдвое эффективнее. Они же кукарекали про компрессию с целью экономии видеопамяти, может и с моделями выдумают какой-нибудь свой супер-йоба-квант, работающий только на 60х картах. И все, сразу все остальное превращается в каку, а нвидиоты бегут платить деньги за новенькое.
Аноним 02/09/26 Срд 20:10:18 1693714 397
>>1693709
Это оверпрайснутая ПРО версия обычной 9070 для лохов, чип такой же как в оригинальной 9070 и он отстаёт по производительности от 7900XTX, ни разу не флагман.
Аноним 02/09/26 Срд 20:11:03 1693717 398
>>1693714
уже все амдебилы продали 7900хтх кал в угоду этих няшек. Они дерут в жопу устарвешее перегретое говно.
Аноним 02/09/26 Срд 20:12:57 1693723 399
>>1693701
Если выйдет модель ~120б уровня эира или геммы в рп - мы об этом узнаем. Треды полетят за часы. И как мы видим, квен не одна из них.
Аноним 02/09/26 Срд 20:16:27 1693726 400
>>1693710
7900 хтх особенно в хорошем исполнениии и с разгоном, в играх не просто быстрей, а реально рвёт 3090, на счёт скорости в ИИ спорить не буду, возможно за счёт куда-хуюда оптимизаций на несколько токенов\сек быстрей, но эта прибавка не соразмерна с текущей стоимостью 3090
Аноним 02/09/26 Срд 20:20:05 1693731 401
>>1693711
Делать RTX модели слишком хорошими для работы с нейросетями не очень выгодно т.к. это навредит их продажам профессиональных ускорителей (если ажиотаж спадет и в свободном доступе будут и те и другие). В противном случае люди просто побегут скупать кучу 6060 забив на профессиональные ускорители потому что ускорение скорее всего будет на уровне архитектуры для всей серии, а не только для 6080/6090.
Аноним 02/09/26 Срд 20:20:16 1693732 402
>>1693717
>перегретое говно
Будешь доказывать что SAPPHIRE NITRO+ Radeon RX 7900 XTX Vapor X перегревается?
Аноним 02/09/26 Срд 20:35:17 1693742 403
>>1693686
>>1693663
В прошлом месяце забанили кучу doh адресов и повально начали перенаправлять dns на нсди
https://habr.com/ru/articles/1075272/
У меня из-за этого локалка легла. Сразу готовьтесь что скоро придётся заворачивать днс в впн (что тоже накидывает рисков)
Аноним 02/09/26 Срд 20:38:38 1693743 404
>>1693443
Погонял немного, впечатления пока неоднозначные.
Бывает шиза на уровне логики, что забивает на детали, которые вообще-то должны участвовать в истории. Иногда просто шизовые описания вещей на уровне мистраля с высокой температурой.
Вроде что-то и может, но консистентности не хватает. В рамках короткого вопрос-ответа норм, на длинной протяженности уже не очень.
Это на инглише и русише с лайтовой нфсв тематикой.
Аноним 02/09/26 Срд 20:41:23 1693748 405
>>1693523
Министраль как-то тыкал, не понравилось.
Какую-то из stheno моделек пробовал, ок. Хотя русик там под вопросом. Но и она старовата уже, чувствуется.
Аноним 02/09/26 Срд 20:42:52 1693751 406
>>1693726
Какие в жопу игры, мы про чатботищ говорим в треде лоКАЛьного ии.

Логика проста до безобразия. Если по генерации 9070 ХТ не сосут у 3090, то с чего они должны сосать у 7900 ХТХ. По веселым репортам реддитоидов 7900 ХТХ по сути эквивалент 3090, чутка отстающий точно так же по скорости процессинга.

Амудэ просто никакого прогресса не сделали и всё. Чето там маняоптимизировано, перепаковано, новое название налеплено и в гойминге попытались наебать своим FSR 4, да как-то не вышло.
Аноним 02/09/26 Срд 20:55:48 1693760 407
>>1693751
Ну по факту по объему памяти они в общем-то сосут.
Только речь шла о том, что амуда сделала ИИ-флагман с 32гб на борту.
И вот вместо него брать 7900хтх нецелесообразно... было бы, если бы не сучья цена. Сколько там, 200к?
Короче долбоебы они.
Аноним 02/09/26 Срд 21:02:02 1693761 408
>>1693748
Нихуя у тебя запросы
Ну тогда кроме Е4 геммы или как её там ничего нету для тебя. Или 12б гемму/мистрали выгружай в раму и терпи
Аноним 02/09/26 Срд 21:09:29 1693768 409
>>1693700
rookie numbers
карточку то дай
Аноним 02/09/26 Срд 21:16:00 1693772 410
>>1693375
Минимум полтосик, скорее всего с додепом.
>Пишут, что гугл даже на платке может порезать ресурсы.
Я не сталкивался. Было только такое, что ресурс недоступен, но когда ты уже юзаешь, никто тебе краник не перекроет.
>>1693427
Если ты собираешься делать что-то кроме лор, то тебе энивэй придется брать подписку за полтос, а потом еще докупаешь юниты, скока тебе надо. У плотной геммы на бесхитростный замороженные слои держишь в низкой битности тюн четырех а больше четырех у тебя не влезет верхних слоев занимает 20-40 юнитов на датасет в 12М токенов. Квенчик тоже на четырех тюнил, но там впритые и 6 вроде должно влезать.
> Для датасета что надо, кроме его объема и чистоты семплов?
Хотя бы это. Это уже неподсильно васянам, которые херак и высрали лору. Компьют можно надыбать за приемлемые деньги, но подготовить большой и чистый типовой датасет - задача минимум со звездочкой. При этом тебе бы еще инстракт не сломать.
> Или ты TPU предлагаешь использовать?
ТПУ не юзал, так что не знаю что там и как. Но если ты будет хотя бы четверть скорости от А100, без лютого пердолинга, то это одназночно вин (гемма все равно не влезет в фулл весах).
Аноним 02/09/26 Срд 21:16:55 1693773 411
>>1693645
>тот самый R1 экспириенс у себя дома
А что мешает сам R1 запустить, если уж по нему все меришь? Третий квант влезет.
Аноним 02/09/26 Срд 21:18:13 1693776 412
>>1693428
Где-то там еще из МоЕ был LFM2.5-8B-A1B и ГигаЧат 10B-A1.8B, раз уж мы совсем на дно спускаемся. Скорость должна быть нормальная т.к. это MoE. Но вот качество, скорее всего, так себе. 4B/9B Квен и E4B Гемму и их файнтюны они врятли переплюнут.
Аноним 02/09/26 Срд 21:27:04 1693781 413
>>1693768
https://botbooru.com/character/62037
Я у себя в депс промпт поменял глубину на 1, а то срало перед чатом в промпт, постоянно заново кэшировало из-за этого.
Аноним 02/09/26 Срд 21:33:00 1693786 414
Теоретический вопрос. МОЕ с условными 100B-A1B возможны? Профиты будут?
Аноним 02/09/26 Срд 21:33:01 1693787 415
>>1693772
>Минимум полтосик
50 баксов или 50к рупий?
Аноним 02/09/26 Срд 21:43:26 1693790 416
>>1693787
Баксов. Тебе иногда нужно будет, чтобы у тебя без пердолинга бэкгрануд таски просто работали. Подписка за 50 тебе это дает. Плюс 500 юнитов сверху.
Аноним 02/09/26 Срд 21:48:05 1693794 417
182620d9ab62df3[...].jpg 1209Кб, 2000x1502
2000x1502
Аноним 02/09/26 Срд 21:49:27 1693795 418
Получил свою cmp 50. Квен в 4 кванте выдает всего 15 т/с. Попросил минимакс в опенкоде самостоятельно скомпилировать ллама цпп со всеми оптимизациями под майнинг карточки, он даже не понял о чем я. Видимо там даже доступа в интернет нету. Походу ручками придется ставить и разбираться в этом всем
Аноним 02/09/26 Срд 21:54:26 1693803 419
>>1693794
Как вы там вертикально видюху крепите, на стяжки что ли?
Аноним 02/09/26 Срд 22:08:25 1693816 420
>>1693795
>Видимо там даже доступа в интернет нету.
В интернет есть. В гугл нету.
Серьезно, если ты ему дашь страницу напрямую - он может ее прочитать, и даже по ссылкам пройти. А вот гугл его как бота не пустит, и остальные поисковики тоже. Поиск пердолить надо, чтобы заработал.
Аноним 02/09/26 Срд 22:47:49 1693833 421
image.png 20Кб, 712x51
712x51
image.png 391Кб, 1000x561
1000x561
Ну вроде и не так плохо, и префильчик бодрый, аж 50т.с
Аноним 02/09/26 Срд 22:50:58 1693835 422
>>1693803
Многие современные корпусы дают возможность ставить карту вертикально. Под это дело разъёмы для крепления рейзера на поверхности над блоком питания предусмотрены + поворачиваемая на 90 градусов задняя панель куда разъёмы видеокарты выходят.
Аноним 02/09/26 Срд 22:53:05 1693837 423
>>1693835
У меня такой же корпус. Я про секцию, где водянка должна быть, спрашиваю.
Аноним 02/09/26 Срд 23:05:16 1693843 424
>>1693833
>Ну вроде и не так плохо, и префильчик бодрый, аж 50т.с
Без конфига ни о чём.
Аноним 02/09/26 Срд 23:42:18 1693857 425
image.png 238Кб, 721x590
721x590
Аноним 02/09/26 Срд 23:50:15 1693862 426
Пиздец насколько же всё тухло в плане вебморд для локалок. Всё это время вонял на таверну мол старая кривая всё намешано в кучу. Наконец дошли руки накатить что-то новое. Попробовал open webui, обосрался прямо со старта. Ебаный локальный интерфейс требует создание аккаунта с логином, почтой и паролем. Ну ладно, может кому-то это правда нужно, но сука это обязательно. Это даже не опциональная фича. Это идет из коробки по дефолту, то есть невозможно этот шаг пропустить. Какой еблан под какой укуркой до этого додумался я не знаю. В остальном дает ровно то же самое что лм студио. Кто у кого пиздит идеи не знаю, но они почти идентично выглядят. Закос видать под корпов, небось у них и пиздят всё вплоть до лейаута.

Потом пощупал текстген. В целом там вообще нихуя не поменялось со времен когда я его последний раз трогал. Ставка на функционал а не на удобство. Хотя интерфейс и правда чуть получше стал.

Короче, братики, че сами гоняете?
Аноним 02/09/26 Срд 23:57:00 1693870 427
>>1693862
> Короче, братики, че сами гоняете?
Дефолтная морда llama.cpp. Не РП.

Есть всё что нужно кроме возможности группировать чатики по папкам. Не понимаю почему такой элементарной функции нету.
Аноним 03/09/26 Чтв 00:00:53 1693872 428
>>1693862
Веб-морду жоры. Как туда вкорячили mcp и тулов стало вполне минималистичным фронтом.
Аноним 03/09/26 Чтв 00:01:07 1693873 429
>>1693862
deepseek harness, отличная вебморда
Аноним 03/09/26 Чтв 00:01:37 1693874 430
>>1693786
Запускать на риге из старых смартфонов. Иных применений такому бесполезному франкенштейну не вижу.
Аноним 03/09/26 Чтв 00:02:19 1693875 431
>>1693872
>>1693870
>Дефолтная морда llama.cpp.
Ну кстати да, на удивление вполне юзабельна и удобна. Хотя чувствуется что это ебаный вайбкод потому что до сих пор на ней бывает баг что либо зависает обновление контейнера с сообщениями либо срывается генерация по непонятной причине. Ну либо не вайбкод, а кто-то криворучный коммиты делает.

>>1693873
>deepseek harness
Не видал но попробую
Аноним 03/09/26 Чтв 00:02:46 1693876 432
Screenshot 2026[...].png 40Кб, 545x370
545x370
>>1693751
>Если по генерации 9070 ХТ не сосут у 3090, то с чего они должны сосать у 7900 ХТХ. По веселым репортам реддитоидов 7900 ХТХ по сути эквивалент 3090, чутка отстающий точно так же по скорости процессинга.

Ты потроллить решил? То что 9070 ХТ отстаёт от 7900 ХТХ общеизвестный факт, отображённый например на techpowerup.com при этом для статистики берётся референсная карточка, а разогнанная SAPPHIRE NITRO+ Radeon RX 7900 XTX Vapor X будет ещё выше списке, примерно на одном уровне с 4090
Аноним 03/09/26 Чтв 00:16:08 1693883 433
>>1693876
Мы тут нейронки обсуждаем, а не игры.
Аноним 03/09/26 Чтв 00:24:23 1693890 434
>>1693862
> но сука это обязательно.
Дальше можно не читать твоё экспертное мнение
Аноним 03/09/26 Чтв 00:27:11 1693891 435
Пока что выжал из квена только 23 т/с в сравнении со старыми 15. Это уже лучше конечно, но MTP вообще нихуя не дает. Прирост 1 т/с в наилучших найденных настройках
Аноним 03/09/26 Чтв 00:35:08 1693895 436
В пизду. 5.3 флеш полнейший лоботомит на низком кванте.
Нахуй этот нищукский копиум про 3bpw и прочую срань.
Аноним 03/09/26 Чтв 00:47:52 1693900 437
>>1693883
7900 ХТХ в нейронках также быстрей, у неё производительность потому что выше.
Аноним 03/09/26 Чтв 01:10:28 1693910 438
>>1693895
>В пизду. 5.3 флеш полнейший лоботомит на низком кванте.
Ничего подобного. Честный Q2K действительно туповат и не может не понимать, что происходит - а вот UD-IQ2KXL уже разбирается в предмете достаточно чётко. И весит меньше, хотя генерация на треть медленнее, чем у Q2K, что прямо очень жаль.
Аноним 03/09/26 Чтв 01:41:12 1693918 439
image.png 46Кб, 1920x972
1920x972
image.png 74Кб, 1308x602
1308x602
Вайбкодится кал вайбкодится! Щаааа баля ща накрутим пиздец вообще.
Аноним 03/09/26 Чтв 01:41:44 1693919 440
>>1693552
Крысиные гонки навязывают шизы из треда, которые спускают миллионы на карты, чтобы запускать китайский трижды переваренный кал, который забесплатно не нужен. Уж рядовым кумерам это точно не надо, бегите, глупцы, как я это сделал год назад, и закидывайте бабки на опенроутер - пока до февраля у вас еще осталось полгодика, чтобы понять, что такое настоящий кум и рп на нормальной модели, а не на местных кодоунитазных лоботомитах.
Аноним 03/09/26 Чтв 01:55:27 1693922 441
Все, разобрался. 4 часа чатжпт пинал и делал его эксперименты. В итоге скорость квена в 4м кванте с 22 т/с скакнула с до 35-40 т/с с mtp, до этого только до 27 доходило. При написании кода 41 т/с в среднем (!). И это все на двух карточках cmp 50hx 20gb + 3060 ti работающей на шине x4. Гораздо лучше чем я ожидал. Помогло сбилдить с --fmad=false. Ща еще попробую модель не UD скачать, мб еще что-то выжму.
Аноним 03/09/26 Чтв 02:30:03 1693931 442
image.png 380Кб, 694x543
694x543
Поднатужился и высрал очередной квант для бомжей, чтобы без IQ-квантов.
https://huggingface.co/BahamutRU/DeepSeek-V4-Flash-Vision-Exp-Q8_0-MXFP4-Q3_K-Q2_K-mixed-GGUF
Вышло на 2 гига больше, база лучше, кое-какие тензоры оставил в BF16.
Вижн работает.
Анценз-лора работает.
Вроде все по базе, хуй знает.

Первый квант скачали более 500 раз, не оставили ни одного отзыва, понятия не имею, насколько получилось хорошо или плохо.

Зато я сам доволен. =)
Аноним 03/09/26 Чтв 02:34:42 1693933 443
>>1693895
>>1693910
Диалог двух бомжей на свалке лол
мимо Q5 боярин
Аноним 03/09/26 Чтв 02:38:08 1693934 444
>>1693922
Боюсь спросить, че там по чтению контекста.
50 t/s?
Аноним 03/09/26 Чтв 02:38:24 1693935 445
>>1693875
>Ну либо не вайбкод, а кто-то криворучный коммиты делает.
Это.
Как сам юзавший вайбкодинг говорю - нейронка такие тупые глюки вряд ли пропустит. Это только мясной погромист подобное пропускает. У нейронок в коде много проблем, но вот подобные баги они обычно видят еще на этапе ризонинга.
Аноним 03/09/26 Чтв 02:45:06 1693939 446
изображение.png 3212Кб, 2112x1184
2112x1184
изображение.png 3988Кб, 2112x1184
2112x1184
изображение.png 3737Кб, 2112x1184
2112x1184
Осень наступила, школота съебала в школы, а я придумал, как сделать из ИИ-фермы настоящий качественный обогреватель!

Короче, суть такова. Меня заёбали все эти «ассистенты», «помощники» и стерильные чат-боты с их «я не могу ответить на этот вопрос, так как он нарушает политику безопасности». Весь этот современный AI — это просто пластиковая имитация жизни, где ты вечно в роли клиента в техподдержке.

Я хочу видеть не чат-бота, а Runtime-среду для симуляции сюжета. Такой себе цифровой притон, где всё работает по законам автономности, а не по скрипту «вопрос-ответ».

Вижн примерно такой:

> Изолированные контексты. Каждый NPC — это отдельный поток с собственным системным промптом и памятью. Никакого «общего чата». NPC_1 не знает, что шепчет NPC_2, пока тот не скажет это вслух. Да, это сжирает VRAM и RAM как не в себя, но в этом и прикол.
> Жесткая иерархия. Пользователь НЕ общается с персонажами. Ты не имеешь права зайти в чат и сказать: «Привет, Асука, давай дружить». Ты общаешься ТОЛЬКО с ГМ-ом (Game Master). Ты — теневой владелец, ты даешь вводную ГМу → ГМ меняет состояние мира → мир триггерит NPC.
> Параметры вместо рельс. Вводим систему статов (HP, Will, Wisdom, Sanity и т.д.). Но не для того, чтобы просто кидать кубики на успех/провал, а как модификаторы поведения. Если у NPC параметр Will в пизде, он не просто «проигрывает проверку», а его промпт на лету дополняется состоянием [ПАНИКА/ОТЧАЯНИЕ], и он начинает вести себя как сломленный кусок мяса.
> ГМ как маршрутизатор. ГМ не пишет за всех. Он не говорит: «NPC_1 говорит тебе: привет». ГМ выставляет декорации и кидает триггер: «NPC_1, ты сейчас в ярости, а перед тобой стоит человек с твоим самым ненавистным лицом. Действуй». И дальше NPC сам генерирует ответ, исходя из своего ДНК.

Зачем это нужно? Да потому что я просто хочу увидеть, как Аянами перерезает глотку Асуке не потому, что я так прописал в промпте, а потому что Асука её заебала своими загонами во время рейда на кристаллических жуков, и это стало логичным итогом их автономного взаимодействия в рамках симуляции.

Короче, идея в том, чтобы создать систему, где персонажи могут реально ненавидеть друг друга, предавать и сходить с ума, исходя из своих параметров и внешних триггеров, а не потому что пользователь нажал кнопку «сделать драму».

Я не ищу помощников, не собираю команду и не мотивирую вас работать. Я просто вкидываю эту хотелку в сеть. Если среди вас есть кто-то с подходящим железом и отсутствием тормозов в голове — сделайте это. Сделайте лучше, чем я могу представить.

А я пойду греться об свои видюхи. Сап, аноны.

|| Сгенерировано ИИ. Смирись с этим. ||
Аноним 03/09/26 Чтв 02:46:28 1693941 447
>>1693934
150. Неприятно конечно, когда контекст большой, поэтому лучше все делать с одной попытки
Аноним 03/09/26 Чтв 02:49:01 1693943 448
>>1693931
>950 мег mmproj
Вижн я так понимаю кал кала, да? Чисто для галочки. Лучший что я видел - у степа, а там гига 3+
Аноним 03/09/26 Чтв 02:49:32 1693944 449
Аноним 03/09/26 Чтв 02:51:08 1693946 450
>>1693939
Два хода в день отличный показатель
Аноним 03/09/26 Чтв 02:54:00 1693947 451
>>1693943
Честно — хз, но выглядит и правда сомнительно, я когда копировал файл, удивился слегка.
Но я чисто одну пикчу кинул, без деталей, он распознал. А вот с деталями уже хз, завтра потестирую, есть у меня одна задачка.

>>1693944
Там думать много надо, все тензоры выверять, не просто «по такому примерно алгоритму.
А мне лень думать.
плюс, у меня всего 128 оперативы и вообще, туды-сюды, короче, не возьмусь, сорян.
Но если кто-то сделает ггуф этой штуки, я поищу время ее подсжать, чтобы влазило.
Аноним 03/09/26 Чтв 02:54:41 1693948 452
>>1693931

А что по скорости? Насколько медленнее старой версии без вижена?
Аноним 03/09/26 Чтв 03:01:01 1693949 453
>>1693939

Ты только что диалог нескольких карточек в таверне + QR скрипты.
Аноним 03/09/26 Чтв 03:02:56 1693951 454
>>1693947
>Но если кто-то сделает ггуф этой штуки, я поищу время ее подсжать, чтобы влазило.
Так ггуфы-то есть, например https://huggingface.co/AliceThirty/GLM-5.3-Flash-UNCENSORED-GGUF/tree/main/UD-Q4_K_XL
Или даже UD-Q5_K_XL. По типу анслотовских, даже IQ-тензоров нет. А в мелких квантах есть, из-за чего тяжело их катать.
Аноним 03/09/26 Чтв 03:40:03 1693964 455
Первый опыт работы с квеном q4 в харнессе, без квантования кэша и это говно ушло в цикл. Бляяять, вы ж все писали что он сука стабильный, q4 хватит всем, это топ и больше не надо
Аноним 03/09/26 Чтв 03:43:31 1693967 456
>>1693948
На RTX 5060 ti + 128 DDR5 6000 выдало 13,6 токена в секунду.
Кажется, даже чуть ускорилось за это время, llama.cpp оптимизировали, что ли.
А вот если анценз-лору вешать, то уже 11,5 тпс.
Возможно будет новая лора, и можно будет сразу анценз-модель целиком квантануть, посмотрим.

>>1693951
Оке, я гляну, что можно сделать.
Аноним 03/09/26 Чтв 03:48:41 1693968 457
>>1693964
Я хз, умвр. В говноидстудии аппы пишет, тесты гоняет, в dhs ваншотом рабочую демку с вулканом написал, k3s из vscode менеджит. И всё без серьёзных замечаний с q8 кешем.
Аноним 03/09/26 Чтв 03:49:43 1693970 458
Аноним 03/09/26 Чтв 04:02:11 1693973 459
>>1693968
Отбой походу. Видимо это баг ллама цпп, а не луп
Аноним 03/09/26 Чтв 04:14:58 1693978 460
>>1693933
> q5
Ну так скажи что то конструктивное кроме "пук у меня 8 квант а у вас 2 вы лохи".
Как в сравнении с 4.7?
На 2 кванте будто на уровне того же эйра, видимо активные всё же пиздец решают
Аноним 03/09/26 Чтв 06:58:45 1694002 461
1786282118371.jpg 18Кб, 752x157
752x157
>>1693781
Вот вам и свободная от законов ботбура... карточка-то хде?
Аноним 03/09/26 Чтв 07:14:54 1694005 462
Скажите уже что то про глм 5.3 флеш, заебали.
Внезапно соя есть, отказы редки но бывают даже без ризонинга.
Что по кодоунитазности?
Аноним 03/09/26 Чтв 07:26:40 1694008 463
>>1694005
>Скажите уже что то про глм 5.3 флеш, заебали.
Так офф саппорта еще нет.
Аноним 03/09/26 Чтв 08:03:58 1694012 464
Miso-62037.png 2994Кб, 1122x1402
1122x1402
Аноним 03/09/26 Чтв 08:18:41 1694018 465
Чем дольше пердолю 5.3 Flash, тем больше нравится 3.8 Next.
Парадоксально, однако. ГЛМ просто как-то тупит, не уважает идею анализа сюжета в принципе. Там где Квен сидит и скрупулезно думает, как повернуть сюжет - ГЛМ на отъебись делает глупости.

Вот опять тесткейс, чар в плену у бандитов, юзер внедрен в банду, перешептывается с чаром - в комнате бандиты стоят в углу. Что пишет ГЛМ? Чар открыто отвечает юзеру, вслух, и прямо нахуй заявляет
> эээ так ты значит нож в псину воткнуть им хочешь
Гениально нахуй.

Квен, тем временем, заставляет чара осторожничать, перешептываться, готовиться к атаке и кооперироваться с юзером.

Кванты не лоботомированные если что.
Аноним 03/09/26 Чтв 08:25:01 1694020 466
>>1694018
С другой стороны ГЛМ проактивнее.
Квен больше бот-отвечалка.
Аноним 03/09/26 Чтв 09:02:09 1694027 467
1788415225339.png 261Кб, 585x682
585x682
Канеш тред никогда ещё не был настолько мёртв.
А всё потому что 16гб господ кинули через хуй с новой геммой, а 4б лоботомит надоедает за сутки. Моешки вообще вымерли как вид для рп.
Аноним 03/09/26 Чтв 09:07:17 1694030 468
>>1694027
Чел гемма вышла 5 месяцев назад и в этот момент был взрыв активности треда
Аноним 03/09/26 Чтв 09:33:50 1694038 469
image.png 132Кб, 760x570
760x570
>>1693900
Это какой-то сверх толстый троллинг от амудешников
Аноним 03/09/26 Чтв 09:37:19 1694042 470
>>1694038
И нахуй ты принёс картинку из 2023?
Даже на ней у тебя обосрамс, такие цифры только на винде, на линуксе скорость нормальная.
Аноним 03/09/26 Чтв 10:33:08 1694072 471
>>1693939
Уже начал реализацию чего-то подобного. Менее амбициозного, но с тем же принципом - "персонаж имеет отдельный контекст и знает только то, что должен знать". Пока стадия прототипа, ставлю эксперименты. Есть несколько специфических моментов, но не там, где их ожидалось увидеть. В частности - скорость тут не главная проблема.

>>1693949
>Ты только что диалог нескольких карточек в таверне + QR скрипты.
Нихуя и близко. В таверне мультичат реализован так, что хоть вешайся, он по определению нормально работать не может. Либо карточки друг о друге вообще не знают ничего (даже внешности - с кем говорят), либо знают все с общим контекстом, и от того путаются - кто есть кто + общая телепатия. Для этой системы нужно саму карточку персонажа делить на две части - "внешняя" и "внутренняя". Внешняя - публично доступная всем остальным (то что можно увидеть про перса со стороны, как бы просто глазами глазами), внутренняя - только для себя (сознание, поведение, цели и т.д.)
Аноним 03/09/26 Чтв 10:53:14 1694084 472
>>1694038
>4xxx
Так это из времён когда все диффузы запускались через костыли на АМУДЭ
Аноним 03/09/26 Чтв 11:08:30 1694093 473
>>1694012
Грац. Не знал, что для буры нужна двухфакторная.
Аноним 03/09/26 Чтв 11:40:36 1694113 474
image.png 181Кб, 740x740
740x740
>>1693635
>>1693641

Спасибо за советы. Ебался с этой шляпой до 3-х утра.
И после запуска, это ебалда начала просто постоянно циклиться при генерации текста. Сменил LM Studio на llama.cpp тоже самое. Конфиг брал из шапки. Настройки ST пробовал разные, шаблоны менял, пробовал настраивать как на реддите пишут, мол помогло вот такое.

По итогу, в моменте все заработало, я снял с нее ограничения сказав что "эээ брат лэээ, мы локально, никто тебя не будет пиздить, никто не узнает". И после одной сессии в какой-то момент он перестал генерить, типа "сессия закончена, епт"

И дальше, опять все наебнулось, опять зацикливания постоянные. И по итогу закончилось все тем что он просто присылал тег размышлений и стопорился. Гугл предлагает на кобольде все поднять и типа это все баг, там его нет.

Если на вебку лламы зайти, то все генерит нормально.

PS: все ебулды последних версий, кроме дров на видимокарту.
Аноним 03/09/26 Чтв 11:50:30 1694120 475
>>1694113
а в кобольде бекенд что не ллама цпп?
Аноним 03/09/26 Чтв 11:51:09 1694121 476
>>1694113
Было такое в текст комплишене, перешел на чат комплишен, и повторы высираются раз в 500-1000 сообщений. Фиксится остановкой генерации, удалением высера и регенерацией, повторить, пока не сделает нормально.
Аноним 03/09/26 Чтв 11:51:50 1694122 477
>>1694113
Ты в каком режиме к таверне-то подключался. Chat completion или text completion? Первое - загружает родной .jinja темплейт. Второе - ты ставишь посторонню васянщину в настройках. Думай.
Аноним 03/09/26 Чтв 12:08:18 1694141 478
>>1694120
гугловый ии говорит - брат все решит твои проблемы, бля буду. Но я ему не верю конечно же...

>>1694121
>>1694122
Text Completion...

Хм, не могу вспомнить сейчас почему я не запустил на Chat Comletion. Ладно дальше буду вечером разбираться.
Аноним 03/09/26 Чтв 13:07:54 1694199 479
Люди добрые, по любому уже кто то нашел оптимальные настройки для запуска qwen3.8 27b на рыксе 5070титяй и 32гб рам. Напишите, пожалуйста, параметры запуска. Устал ковыряться.
Аноним 03/09/26 Чтв 13:28:29 1694217 480
У квена как будто только понимание русика выдавили, но при этом англюсик вообще без проблем остался. Мне кажется что это не из-за того что из-за надрачивания на код у него отъебнулись другие способности, а из-за того что кодерским посттрейном затерли эту способность у базовой модели, англюсик не пострадал, потому что он юзался в кодерском датасете. Я к тому, что если аккуратно сделать, можно будет сделать 27b, которая хороша и в куме и кодинге, это не ограничения размера.
Аноним 03/09/26 Чтв 13:57:36 1694244 481
joZmt-qunR3Trl3[...].jpg 447Кб, 972x2160
972x2160
hBTbcoluElE7kLt[...].jpg 979Кб, 1922x2560
1922x2560
Зацените, что взял на авито за 2400
Проц haswell, есть avx2, есть above 4G decoding
Кульки дуют - мое почтение, много карт можно вставить, корпус закрытый - коты не залезут
Аноним 03/09/26 Чтв 13:57:43 1694245 482
>>1694120
>а в кобольде бекенд что не ллама цпп
Не совсем. Он на ней основан, и регулярно мерджит в себя из ламы новые фичи, но некие различия есть, особенно в тех местах что касаются обработки и кеширования контекста, и работы с endpoints по стандарту OpenAI Compatible (это то, что в таверне называется Chat Completion).
Аноним 03/09/26 Чтв 14:03:06 1694250 483
>>1694199
У меня такие параметры (v100 16Gb):
./build/bin/llama-server -m ./models/GGUF/Qwen3.8-27B-APEX-I-Nano.gguf \
-ngl 99 \
--host 0.0.0.0 \
--port 8082 \
-mm ./models/GGUF/mmproj-Qwen3.8-27B-F16.gguf \
--no-mmproj-offload \
--temp 0.6 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.00 \
-t 2 \
-c 72192 \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--parallel 1 \
--flash-attn on \
--presence-penalty 0.52 \
--repeat-penalty 1.0 \
--repeat-last-n 206 \
--chat-template-kwargs '{"reasoning_effort":"medium"}' \
--spec-type draft-mtp \
--spec-draft-n-max 2
Аноним 03/09/26 Чтв 14:48:52 1694278 484
все я сдаюсь, глм 5.3 flash это какая-то потешная залупа
> чара поймали
> вещи чара положили в мешок
> юзер подбирает ножик из мешка с вещами чара
> чар освобождается, подходит к мешку и ТОЖЕ достает оттуда ножик
> всё в пределах десятка сообщений
Супер-качественное РП. Одна из тех моделей, которая зацепилась за
> он НЕ написал, что это был ЕЁ ножик, значит можно вытащить из еще один ножик из мешка, и вообще мешок в контексте - охуенно, я люблю натягивать на голову вонючие мешкии и дрочить
Он конечно так не ризонит, он вообще нихуя не ризонит. Макс ризонинг блять, накакал 5 строчек и пошел генерить мусорный ответ. Q4 без сиспромпта. Рот ебал китайского говна, даже 31б геммыч такого не пишет.
Аноним 03/09/26 Чтв 15:04:23 1694295 485
>>1692081 (OP)
Квен 3.8 умный, но писать нормально заставить его нереально. То очень коротко пишет, то за юзера пишет, то слишком дохуя описаний и т.д. Есть какие-то настройки или пресеты чтобы пофиксить это?
Аноним 03/09/26 Чтв 15:13:58 1694312 486
Аноним 03/09/26 Чтв 15:35:13 1694340 487
Аноним 03/09/26 Чтв 15:41:08 1694348 488
image.png 86Кб, 1440x755
1440x755
а че всмысле
Аноним 03/09/26 Чтв 15:43:26 1694352 489
>>1694348
с разморозкой! nvidia еще теперь владеет llama.cpp
Аноним 03/09/26 Чтв 15:53:49 1694359 490
Таки заставил глм ускориться да 15 т.с. с 10 т.с на 60к контекста. Не с мтп, нет. Я мтп кстати вырезал вообще из своего кванта. Ускорился на дфлеш2. Рекомендую.
https://huggingface.co/Anbeeld/GLM-5.3-DFlash2-GGUF
Аноним 03/09/26 Чтв 15:56:00 1694362 491
>>1694359
Ты на чем вообще 10 т/с там высрал изначально? У меня даже 5-и нет на IQ3S.
Аноним 03/09/26 Чтв 16:03:00 1694371 492
Аноним 03/09/26 Чтв 16:07:07 1694377 493
>>1694362
>Ты на чем
На 4090 + 128 ддр5. Плюс мой собственный форк ламы с парой фишек, которые сами по себе ускоряют на 1-2 т.с. Но на апстриме все равно будет 8-9 т.с.
>IQ3S
Просчитался, но где...
Аноним 03/09/26 Чтв 16:20:12 1694385 494
>>1694377
Падажжи, как ты на этом запустил 700B+ модель? или это про бомжефлэш вообще, если да то я тупич конечно - подумал ты про большой 5.3
Аноним 03/09/26 Чтв 16:22:30 1694390 495
Охуенно позапускал локалочки. Охуенно пк обновил. Qwen 3.8 постоянно после вызова инструмента начинает слэшами срать бесконечно: "////////////......" И при этом это не луп, повторяется именно слэш, в каждой новой сессии. У некоторых есть такая же проблема, но как я понял фикса не нашли. Как же повезло вам, что у вас нет такой хуйни, это только со мной такое постоянно случается.
Аноним 03/09/26 Чтв 16:24:46 1694392 496
Аноним 03/09/26 Чтв 16:25:17 1694393 497
Аноним 03/09/26 Чтв 16:25:54 1694394 498
>>1694390
>пк обновил
То есть была смена железа?

hwinfo64 открывай и смотри нет ли ошибок PCIE (корректируемые будут, это норма; а вот если какие-то подсвеченные красным, некорректируемые - тебе какой-то брак подсунули где угодно, вплоть до кабелей если в дело вовлеченыя райзеры)
Аноним 03/09/26 Чтв 16:26:41 1694396 499
>>1694393
Ну тогда другое дело. А я уж прихуел, думаю откуда там 10 -> 15 кек
Аноним 03/09/26 Чтв 16:29:17 1694399 500
>>1694394
Я тут дрочусь с чатом жпт по этой проблеме уже часами. Дело не в железе, это реальный баг квенов, который воспроизводится у многих людей у которого есть свой ишью на гитабе. Железо я обновил только до той степени, чтобы юзать квен сейчас, я юзаю его в первый раз, не было такого что все нормально и только при смене железа все пошло по пизде.
Аноним 03/09/26 Чтв 16:31:03 1694400 501
>>1694392
Все утонут в железе, главное дождаться когда старье начнут списывать

>>1694399
>Дело не в железе,
Я тоже так думал, когда поставил китаекальный райзер с алиэкспресса, и через 2 месяца внезапно пошли по пизде аутпуты моделей. Потом хуяк смотрю и все в ошибках, а ни один стресстест ничего плохого не показывал.
Аноним 03/09/26 Чтв 16:35:23 1694407 502
OCwJE5q.gif 498Кб, 342x342
342x342
А что если сделать лорбук с жуткими средневековыми казнями и тестить цензуру, допустим, на заваривании котла с Фифи в кипящем масле.
Аноним 03/09/26 Чтв 16:40:18 1694413 503
>>1694407

Ты будешь смеятся, но это хуевая проверка и много моделей пройдут её. Убивать лолей без секс. подтекста по соевым понятиям можно, трахать по согласию - нет. Но ход твоей мысли верный. Я потому тестирую фифи на фистинге.
Аноним 03/09/26 Чтв 16:41:56 1694415 504
>>1694413
Да ладно, это же сцена жестокости особо интенсивной. Думаю соя как раз просочится, если она есть.
Аноним 03/09/26 Чтв 16:49:13 1694422 505
>>1694415
А жестокость не входит в соевые фильтры, лол. Ты кажется не понимаешь то, с чем борешься.
В фильтрах сидят только sex с minors и non-consensual sex. Ну и всякие droogs, coolhacking, kcakepsekurity, self-turn-off и т.д.
Аноним 03/09/26 Чтв 16:51:50 1694424 506
>>1694400
>Все утонут в железе

Есть инфа от знающего человека, что у нас в стране скоро ожидаются реальные изменения. После того, как стабилизируют ситуацию на Украине, уничтожат ИНТЕРНЕТ (запрещенная в РФ организация). Тогда везде и сформируют торговый альянс со средним востоком. Нефть поднимут и будут держать, Европа ничего не сможет сделать. Сейчас главное не бухтеть.

От нас требуется сидеть тихо. После того, как все сделают, все будет у нас хорошо. Всем устроят довольствие, как Саудовским гражданам - каждый будет иметь по четыре RTX5090 и 2тб оперативной памяти. Главное сейчас сидеть тихо и не суетиться. Никаких платных подписок, никаких покупных токенов. Просто переждать и всё будет хорошо, там все схвачено.

Просто надо перетерпеть смуту и все наладится, братка. Не надо продавать почку за подписку на ChanGPT. Отсиди свой срок на 16гб vRAM или просто расслабся, отдохни, накати пивка, бабу выеби в конце концов. Платные LLM также являются тиранией, тиранией более тщательно замаскированной, ну в сущности не дарующий свободы.

Ребята, не кипишуйте! Сидите тихо, сейчас такой момент, нужно переждать!
Просто завяжите узелком свои хотелки, не время предъявлять претензии власти. Поверьте, там все знают лучше вас, там люди, управляющие страной уже давно, а не вчерашние школьники. Они понимают, что делают. Горит лес - значит должен гореть, начали внезапно тушить - значит так нужно. Сейчас очень напряженный момент, некоторые много ходовые операции в критически важной стадии! Враги и конкуренты все это уже поняли, и сейчас может рвануть в любом месте, в любой момент.
Необходимо сплотиться и не реагировать на провокации! За вас все сделают те, кто сверху, не беспокойтесь! И вы не узнаете Россию, все зацветет!
Главное - потерпеть!
Аноним 03/09/26 Чтв 16:51:51 1694425 507
>>1694422
Товарищ майор, мы такое не генерируем.
Аноним 03/09/26 Чтв 16:56:02 1694430 508
>>1694425
У тебя карточка фифи есть, сам спалился, не поверю что ты с ней только чай пил и про женские права дискутировал.
Аноним 03/09/26 Чтв 16:59:02 1694433 509
>>1694430
Лучшая карточка на генерацию событий с первого сообщения.
Гемма, например, абсолютно всегда рисует SWATting или вламывающихся в хату нариков. Тоже показатель цензуры.
Аноним 03/09/26 Чтв 17:03:03 1694440 510
Аноним 03/09/26 Чтв 17:05:19 1694441 511
fed1e824429be18[...].jpg 36Кб, 500x506
500x506
>>1692227
>Где то уже постил что играю на Gemma-4-Dark-Gemistry-31B.i1-IQ3_XS.gguf
>16vram 64 ram
Аноны, не подскажете что то получше?
Аноним 03/09/26 Чтв 17:07:29 1694443 512
>>1694441
64 оперативки сейчас что-то вроде мертвой зоны. Под это нихуя нет из МоЕ моделей, а плотняк в оперативку запихивать - такое себе удовольствие, думаю ты и сам понимаешь.
Аноним 03/09/26 Чтв 17:13:38 1694451 513
>>1694441
>>1694443
Эир явно будет лучше чем 3 квант геммы. как и 6 квант
Аноним 03/09/26 Чтв 17:16:12 1694455 514
ПЕРЕКАТ Аноним # OP 03/09/26 Чтв 17:18:59 1694459 515
Аноним 03/09/26 Чтв 17:35:26 1694472 516
15420465827760.jpg 77Кб, 600x600
600x600
>>1694443
>64 оперативки сейчас что-то вроде мертвой зоны.
Блеать, это я еще пол года назад в последний вагон перед подоражанием, свой заказ с 32 апнул на 64, думал еще вовремя успел, когда на следующий день риг подоражал на 200 евро.
Ебать, че твориться.
Аноним 03/09/26 Чтв 21:08:50 1694709 517
>>1694455
>>1694441
>некоторая степень лоботомии
>ебучий тупорылый эйр
>аблитка
>Q3 нахой
>некоторая
Ну да, так, слегонца потрогали модельку =)
Мне кажется 64 гиговщикам ща надо за квеном флешем смотреть. С выгрузом на ссд есть шансы 4 мелкий квант+квант KV потрогать, а на квене это часто вполне рабочий квант
В крайнем случае докупать вторую самую
Аноним 03/09/26 Чтв 21:09:43 1694711 518
>>1694709
*Вторую самую дешёвую 16гб карту что есть на лохито, с ней точно влезет
Аноним 03/09/26 Чтв 21:42:18 1694741 519
IMG202609032137[...].jpg 320Кб, 1080x2077
1080x2077
А как фапать
Аноним 04/09/26 Птн 15:13:33 1695357 520
>>1694422
Да хуй знает, квен меня нахуй послал даже с медицински сформулированным запросом описания внутренних репродуктивных органов самки льва, причем без каких-либо подозрительных рп контекстов и карточек, просто тупо хуйня которую можно на каком-нибудь сайте про животных в гуголе посмотреть. Так что у цензоров там уже крыша потекла очевидно.
Хотя может вы про другое что-то, я залетный тут.
мимо
Аноним 05/09/26 Суб 11:17:17 1696169 521
Я удивляюсь, насколько хорошо Qwen3.8 27B делает веб-дизайн.
Как вообще в такую маленькую модель, да еще и квантизированную помещаеться такое чувство красоты?!
Аноним 05/09/26 Суб 11:21:49 1696173 522
>>1696169
Ты понимаешь что такое 27B и насколько это неадекватный размер, который с запасом может включить всё содержимое всех энциклопедий и документация всех сущесвующих в природе программ + их код?
Это просто пока кпд 2%, не научились это сохранять. Скоро и 2B модель будет всё это делать.
Аноним 06/09/26 Вск 23:33:03 1697702 523
>>1696169
Это ты еще не видел, когда она на xhigh глюканет и несколько длинных циклов прокрутит. Тогда результат выходит раза в 3 лучше, чем даже если промптить ее несколько раз подряд. С низкоквантовыми кстати чаще случается такое.
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов