Bỏ qua đến nội dung
X.com Pulse

Yell Signals

Điểm tin kỹ thuật, mô hình mã nguồn mở và công cụ lập trình từ cộng đồng quốc tế trên X.com.

11 tín hiệu nóngTự động cập nhật 23:00 ICT hàng ngày
SIGNAL #01#ai#data-infrastructure
X.com
Avatar của Alexandr Wang
Alexandr Wang@alexandr_wang

Alexandr Wang lên tiếng đính chính trước các thông tin sai lệch về Scale AI

Bối cảnh

Trong bối cảnh cạnh tranh khốc liệt về hạ tầng dữ liệu và đánh giá mô hình AI, các đồn đoán và thông tin thiếu kiểm chứng về hiệu năng cũng như hoạt động vận hành thường xuyên xuất hiện trên mạng xã hội. Điều này buộc các nhà sáng lập phải trực tiếp phản hồi để bảo vệ tính minh bạch kỹ thuật của tổ chức.

Điểm cốt lõi (TL;DR)

Scale AI chủ động phản bác các cáo buộc sai lệch, tái khẳng định tiêu chuẩn kỹ thuật và tính minh bạch trong hệ thống dữ liệu phục vụ đào tạo AI.

7.2K406
Mở bài viết
SIGNAL #02#open-source#llm-inference
X.com
Avatar của netrunner
netrunner@plotarmordev

Stanford và NVIDIA ra mắt CLM-8B: Đối thủ mã nguồn mở của Jev với tốc độ suy luận nhanh gấp 9 lần

Bối cảnh

Hệ sinh thái mô hình suy luận hiệu năng cao trước đây thiếu các giải pháp mã nguồn mở thực sự cạnh tranh được với Jev về cả độ chính xác lẫn chi phí phục vụ. Các kỹ sư thường bị giới hạn lựa chọn hoặc đối mặt với độ trễ suy luận lớn khi tự host.

Điểm cốt lõi (TL;DR)

CLM-8B cung cấp trọng số mở hoàn toàn theo giấy phép Apache 2.0, đạt hiệu năng tương đương Jev nhưng tăng tốc độ suy luận lên đến 9 lần. Đây là bước tiến lớn giúp tối ưu hóa chi phí và tốc độ cho các pipeline suy luận cục bộ.

46532
Mở bài viết
SIGNAL #03#local-llm#quantization
X.com
Avatar của 石ちゃんLLMでアプリ開発
石ちゃんLLMでアプリ開発@Isichan_Hitori

Chạy Bonsai-2 27B Uncensored ternarized trên ComfyUI

Bối cảnh

Các mô hình vision-language 27B thường quá nặng cho VRAM phổ thông và ComfyUI mặc định không hỗ trợ trực tiếp các định dạng lượng tử hóa bậc cực thấp.

Điểm cốt lõi (TL;DR)

Nhờ kỹ thuật ternarization, Bonsai-2 27B nén gọn xuống còn 6.7GB với khả năng nhận diện ảnh và tiếng Nhật mạnh mẽ, nhưng cần cấu hình custom để tương thích ComfyUI.

65333
Mở bài viết
SIGNAL #04#devtools#ai-audio
X.com
Avatar của Tom Dörr
Tom Dörr@tom_doerr

Call.md: Ghi âm cuộc họp và bóc băng real-time chạy hoàn toàn local, tự xuất action items sang automation.

Bối cảnh

Các bot ghi âm cuộc họp trên đám mây tiềm ẩn rủi ro rò rỉ dữ liệu doanh nghiệp và thường bị chặn tham gia trong các cuộc họp nội bộ nhạy cảm.

Điểm cốt lõi (TL;DR)

Thu âm và bóc băng trực tiếp trên phần cứng máy tính cá nhân, tự tạo action items và tự động bắn webhook sang workflow automation.

36338
Mở bài viết
SIGNAL #05#qwen#uncensored
X.com
Avatar của Md Ismail Šojal
Md Ismail Šojal@0x0SojalSec

Qwen-Image-2.1 Uncensored: Gỡ bỏ kiểm duyệt, offload RAM chạy local trên CPU, ghép 10 ảnh tham chiếu.

Bối cảnh

Các model sinh ảnh lớn thường áp đặt bộ lọc từ chối quá mức và đòi hỏi lượng VRAM đắt đỏ, gây rào cản lớn cho máy tính cá nhân.

Điểm cốt lõi (TL;DR)

Gỡ bỏ lớp từ chối giải phẫu, offload text encoder sang RAM thường để chạy CPU và ghép cùng lúc tới 10 ảnh tham chiếu chi tiết.

5.2K1.1K
Mở bài viết
SIGNAL #06#apple#qwen
X.com
Avatar của Victor M
Victor M@victormustar

Apple tung model Qwen3.5-9B nén tài liệu dài thành thumbnail để tiết kiệm token khi truy vấn.

Bối cảnh

Xử lý tài liệu dài hàng trăm trang thường làm nghẽn context window và tiêu tốn hàng trăm nghìn token text thô cho những phần không liên quan.

Điểm cốt lõi (TL;DR)

Biến từng trang tài liệu thành ảnh thumbnail nhỏ để lọc nhanh, chỉ giải nén toàn văn của những trang khớp đúng câu hỏi cần tra cứu.

2.2K213
Mở bài viết
SIGNAL #07#audio-ai#asr
X.com
Avatar của Linoy Tsaban
Linoy Tsaban@linoy_tsaban

Audio8-ASR-Infinite: Nhận dạng giọng nói streaming liên tục với rolling KV cache

Bối cảnh

Phần lớn mô hình ASR streaming gặp hiện tượng phình bộ nhớ hoặc trôi ngữ cảnh khi xử lý audio dài liên tục, buộc phải cắt nhỏ chunk và dễ làm mất mạch câu.

Điểm cốt lõi (TL;DR)

Audio8-ASR-Infinite duy trì bộ nhớ và độ trễ không đổi nhờ cửa sổ rolling KV cache 30 giây kèm RoPE re-basing, tích hợp semantic VAD cho phép nhận dạng 24/7.

30232
Mở bài viết
SIGNAL #08#comfyui#ai-media
X.com
Avatar của ComfyUI
ComfyUI@ComfyUI

Comfy Router: Gom toàn bộ model ảnh, video, 3D về 1 endpoint API duy nhất.

Bối cảnh

Các pipeline xử lý AI hiện nay phải duy trì hàng chục SDK và endpoint phân mảnh cho từng model (Wan, Hunyuan, LTX, FLUX, Mochi) với payload tham số xung đột.

Điểm cốt lõi (TL;DR)

Chuẩn hóa một API duy nhất: giữ nguyên prompt và tham số, chuyển đổi toàn bộ model thế hệ mới chỉ bằng một chuỗi định danh.

3.2K489
Mở bài viết
SIGNAL #09#jev#coding-agents
X.com
Avatar của rari
rari@0xwhrrari

Bản thiết kế 12 trang về Jev Harness: Biến coding agent từ chatbot gõ lệnh shell thành engine suy luận thần tốc.

Bối cảnh

Hầu hết framework coding agent hiện nay vẫn coi LLM như một chatbot gắn thêm quyền gõ lệnh shell, gây lãng phí token và độ trễ phản hồi rất lớn.

Điểm cốt lõi (TL;DR)

Bản thiết kế 10 bước tái cấu trúc harness suy luận, cắt bỏ hội thoại rườm rà để tăng tốc 220 lần và giảm chi phí tới 444 lần.

9511
Mở bài viết
SIGNAL #10#generative-ai#diffusion-models
X.com
Avatar của XiaoLei Liu
XiaoLei Liu@leo_xiaolei

Quy trình duy trì tính nhất quán nhân vật trong AI art được kiểm chứng thực tế

Bối cảnh

Việc giữ tính nhất quán cho khuôn mặt và phong cách nhân vật qua nhiều khung hình prompt trong diffusion models vốn là bài toán khó, thường dựa vào trial-and-error thiếu ổn định. Đa số các hướng dẫn trên mạng chỉ mang tính lý thuyết hoặc thiếu tính tái lập trên môi trường thực tế.

Điểm cốt lõi (TL;DR)

Phương pháp luận hoàn chỉnh đã qua vài tháng kiểm thử thực tế, giải quyết triệt để bài toán character consistency với hiệu quả đo lường được.

1.8K242
Mở bài viết
SIGNAL #11#vllm#inference
X.com
Avatar của vLLM
vLLM@vllm_project

vLLM hỗ trợ DiffusionGemma-Jev: Phân loại trắc nghiệm và đọc xác suất tin cậy trong 1 bước.

Bối cảnh

Các bài toán đánh giá Yes/No, trắc nghiệm và trích xuất cấu trúc thường buộc LLM phải sinh token tuần tự chậm chạp qua nhiều bước decode.

Điểm cốt lõi (TL;DR)

Nạp sẵn template câu trả lời, để trống ô đáp án ở dạng nhiễu và đọc phân phối xác suất chỉ trong một bước suy luận duy nhất.

1.1K126
Mở bài viết