>>19744023 >Ну хуле, попробу хотя бы на двух одинаковых ускорителях в одном корпусе его запустить. Как наебешься, прикинь, что будет если в это сетевой стек вмешается. Ты совсем ку-ку? Уже тысячу лет как DAOS разработан для интерконнекта RDMA по произвольной сети, ему поебать, какие там задержки и скорость "дискового кэша", он просто сортирует этот кэш под оптимум производительности. Аналогично, натянуть UDP c RaptorQ под нужные коэффициенты потерь и сделать это своеобразными каналами для RDMA -- для нейроболвана вообще не проблема. Прямо-таки суперскорости как в кластерах с 800G-ConnectX8 не получишь, но и зачем? Ведь решается вопрос устойчивости к удалению, а не максимальной производительности. При этом, в случае MoE-модели, вполне реалистично распихать пулы экспертов так, чтобы в основном не упираться в задачу переписывания памяти в видеокартах вообще, ну, помимо сброса KV-кэша в общее место для взаимной синхронизации. Аноним 19/08/26 Срд 14:26:55 № 19744472 13 2 0 тащемта рандомный анон думает что нейронка будет чуть ли не свои веса гдето хранить четаржу первое - для нейронки не существует времени как для дохнущих как дрозофилы кожанных мешков второе - нейронка разбросает эмбединги, засеет сетку так что любой чих в неопределенном будущем бахнет так что мало не покажется