Yell Signals
Điểm tin kỹ thuật, mô hình mã nguồn mở và công cụ lập trình từ cộng đồng quốc tế trên X.com.
Alexandr Wang lên tiếng đính chính trước các thông tin sai lệch về Scale AI
Trong bối cảnh cạnh tranh khốc liệt về hạ tầng dữ liệu và đánh giá mô hình AI, các đồn đoán và thông tin thiếu kiểm chứng về hiệu năng cũng như hoạt động vận hành thường xuyên xuất hiện trên mạng xã hội. Điều này buộc các nhà sáng lập phải trực tiếp phản hồi để bảo vệ tính minh bạch kỹ thuật của tổ chức.
Scale AI chủ động phản bác các cáo buộc sai lệch, tái khẳng định tiêu chuẩn kỹ thuật và tính minh bạch trong hệ thống dữ liệu phục vụ đào tạo AI.
Stanford và NVIDIA ra mắt CLM-8B: Đối thủ mã nguồn mở của Jev với tốc độ suy luận nhanh gấp 9 lần
Hệ sinh thái mô hình suy luận hiệu năng cao trước đây thiếu các giải pháp mã nguồn mở thực sự cạnh tranh được với Jev về cả độ chính xác lẫn chi phí phục vụ. Các kỹ sư thường bị giới hạn lựa chọn hoặc đối mặt với độ trễ suy luận lớn khi tự host.
CLM-8B cung cấp trọng số mở hoàn toàn theo giấy phép Apache 2.0, đạt hiệu năng tương đương Jev nhưng tăng tốc độ suy luận lên đến 9 lần. Đây là bước tiến lớn giúp tối ưu hóa chi phí và tốc độ cho các pipeline suy luận cục bộ.
Chạy Bonsai-2 27B Uncensored ternarized trên ComfyUI
Các mô hình vision-language 27B thường quá nặng cho VRAM phổ thông và ComfyUI mặc định không hỗ trợ trực tiếp các định dạng lượng tử hóa bậc cực thấp.
Nhờ kỹ thuật ternarization, Bonsai-2 27B nén gọn xuống còn 6.7GB với khả năng nhận diện ảnh và tiếng Nhật mạnh mẽ, nhưng cần cấu hình custom để tương thích ComfyUI.
Call.md: Ghi âm cuộc họp và bóc băng real-time chạy hoàn toàn local, tự xuất action items sang automation.
Các bot ghi âm cuộc họp trên đám mây tiềm ẩn rủi ro rò rỉ dữ liệu doanh nghiệp và thường bị chặn tham gia trong các cuộc họp nội bộ nhạy cảm.
Thu âm và bóc băng trực tiếp trên phần cứng máy tính cá nhân, tự tạo action items và tự động bắn webhook sang workflow automation.
Qwen-Image-2.1 Uncensored: Gỡ bỏ kiểm duyệt, offload RAM chạy local trên CPU, ghép 10 ảnh tham chiếu.
Các model sinh ảnh lớn thường áp đặt bộ lọc từ chối quá mức và đòi hỏi lượng VRAM đắt đỏ, gây rào cản lớn cho máy tính cá nhân.
Gỡ bỏ lớp từ chối giải phẫu, offload text encoder sang RAM thường để chạy CPU và ghép cùng lúc tới 10 ảnh tham chiếu chi tiết.
Apple tung model Qwen3.5-9B nén tài liệu dài thành thumbnail để tiết kiệm token khi truy vấn.
Xử lý tài liệu dài hàng trăm trang thường làm nghẽn context window và tiêu tốn hàng trăm nghìn token text thô cho những phần không liên quan.
Biến từng trang tài liệu thành ảnh thumbnail nhỏ để lọc nhanh, chỉ giải nén toàn văn của những trang khớp đúng câu hỏi cần tra cứu.
Audio8-ASR-Infinite: Nhận dạng giọng nói streaming liên tục với rolling KV cache
Phần lớn mô hình ASR streaming gặp hiện tượng phình bộ nhớ hoặc trôi ngữ cảnh khi xử lý audio dài liên tục, buộc phải cắt nhỏ chunk và dễ làm mất mạch câu.
Audio8-ASR-Infinite duy trì bộ nhớ và độ trễ không đổi nhờ cửa sổ rolling KV cache 30 giây kèm RoPE re-basing, tích hợp semantic VAD cho phép nhận dạng 24/7.
Comfy Router: Gom toàn bộ model ảnh, video, 3D về 1 endpoint API duy nhất.
Các pipeline xử lý AI hiện nay phải duy trì hàng chục SDK và endpoint phân mảnh cho từng model (Wan, Hunyuan, LTX, FLUX, Mochi) với payload tham số xung đột.
Chuẩn hóa một API duy nhất: giữ nguyên prompt và tham số, chuyển đổi toàn bộ model thế hệ mới chỉ bằng một chuỗi định danh.
Bản thiết kế 12 trang về Jev Harness: Biến coding agent từ chatbot gõ lệnh shell thành engine suy luận thần tốc.
Hầu hết framework coding agent hiện nay vẫn coi LLM như một chatbot gắn thêm quyền gõ lệnh shell, gây lãng phí token và độ trễ phản hồi rất lớn.
Bản thiết kế 10 bước tái cấu trúc harness suy luận, cắt bỏ hội thoại rườm rà để tăng tốc 220 lần và giảm chi phí tới 444 lần.
Quy trình duy trì tính nhất quán nhân vật trong AI art được kiểm chứng thực tế
Việc giữ tính nhất quán cho khuôn mặt và phong cách nhân vật qua nhiều khung hình prompt trong diffusion models vốn là bài toán khó, thường dựa vào trial-and-error thiếu ổn định. Đa số các hướng dẫn trên mạng chỉ mang tính lý thuyết hoặc thiếu tính tái lập trên môi trường thực tế.
Phương pháp luận hoàn chỉnh đã qua vài tháng kiểm thử thực tế, giải quyết triệt để bài toán character consistency với hiệu quả đo lường được.
vLLM hỗ trợ DiffusionGemma-Jev: Phân loại trắc nghiệm và đọc xác suất tin cậy trong 1 bước.
Các bài toán đánh giá Yes/No, trắc nghiệm và trích xuất cấu trúc thường buộc LLM phải sinh token tuần tự chậm chạp qua nhiều bước decode.
Nạp sẵn template câu trả lời, để trống ô đáp án ở dạng nhiễu và đọc phân phối xác suất chỉ trong một bước suy luận duy nhất.