VSGA tổng hợp bốn nghiên cứu và sản phẩm AI đáng chú ý trong lĩnh vực viễn thám. Nội dung gồm: khung GeoAI mới giúp kiểm định chất lương bản đồ công trình; mô hình Grok 4.6 của xAI tập trung vào AI agent và chi phí vận hành hợp lý; công nghệ SL2T của Google DeepMind đưa dịch ngôn ngữ ký hiệu lên smartphone; và hệ thống Baguan-solar kết hợp ảnh vệ tinh để dự báo bức xạ mặt trời chính xác hơn.
GeoAI giúp tự động kiểm định chất lượng bản đồ công trình
Một nghiên cứu mới trên arXiv đề xuất một khung GeoAI tự động kiểm định chất lượng dữ liệu dấu chân công trình (building footprint) được trích xuất từ ảnh độ phân giải cao. Thay vì dừng lại ở bước phân đoạn và lập bản đồ, hệ thống tiếp tục kiểm tra các polygon sau khi phân đoạn để phát hiện những sai lệch về hình học và topology trước khi đưa vào cơ sở dữ liệu GIS. Cách tiếp cận này đặc biệt cần thiết bởi các mô hình deep learning đôi khi có thể tạo ra các building footprint bị biến dạng, chồng lấn hoặc không đảm bảo tính nhất quán về topology, từ đó ảnh hưởng đến độ tin cậy và khả năng sử dụng của dữ liệu trong các ứng dụng GIS.
Nghiên cứu kết hợp U-Net và SAM-LoRA để trích xuất building footprint từ ảnh UAV, sau đó chuyển mask raster thành dữ liệu vector và chuẩn hóa hình học. Hệ thống sử dụng 24 đặc trưng không gian (spatial features), bao gồm đặc trưng hình học, ngữ cảnh không gian, phổ và kết cấu ảnh, để xác định những footprint có khả năng bị lỗi.

Kết quả cho thấy mô hình Decision Tree (cây quyết định) đạt độ chính xác 95,31% và F1-score 91,06% trên một khu vực kiểm thử độc lập. Ở cấp cơ sở dữ liệu, hệ thống phát hiện được 87,34% footprint lỗi, đồng thời giữ lại 98,31% các công trình hợp lệ, giúp giảm tỷ lệ lỗi từ 27,32% xuống còn 4,62%.
Nghiên cứu cho thấy GeoAI đang mở rộng từ việc tự động trích xuất đối tượng địa lý sang cả kiểm định và đảm bảo chất lượng dữ liệu không gian, một bước quan trọng để đưa dữ liệu do AI tạo ra vào các quy trình GIS thực tế.
Nguồn: arxiv.org/abs/2608.09048
Grok 4.6 ra mắt, tập trung vào AI agent và hiệu quả chi phí
xAI vừa ra mắt Grok 4.6, phiên bản mới tập trung vào khả năng xử lý các tác vụ phức tạp, kéo dài và sử dụng công cụ như một AI agent. Theo Artificial Analysis, Grok 4.6 đạt 61 điểm Intelligence Index, tăng 5 điểm so với phiên bản trước và ngang GPT-5.6 Sol, đưa model trở lại nhóm AI hàng đầu.

Điểm đáng chú ý nhất nằm ở khả năng làm việc nhiều bước. Grok 4.6 đạt 1.753 Elo trên GDPval-AA v2, thuộc nhóm dẫn đầu về các tác vụ tri thức thực tế; đồng thời đạt 88,4% trên Terminal-Bench v2.1 và 50,7% trên τ³-Banking. xAI cũng cho biết phiên bản mới được cải thiện về khả năng suy luận, lập trình, tương tác với máy tính và các tác vụ dài hơi.
Bên cạnh năng lực, chi phí là lợi thế lớn của Grok 4.6. Model giữ mức giá 2 USD/1 triệu token đầu vào và 6 USD/1 triệu token đầu ra, thấp hơn đáng kể so với các model frontier tương đương. Artificial Analysis đo được chi phí trung bình khoảng 0,84 USD mỗi task, trong khi Grok 4.6 cũng có xu hướng hoàn thành các tác vụ dài với ít lượt tương tác và ít token hơn.
Với Grok 4.6, xAI đang cho thấy cuộc đua AI không chỉ xoay quanh model nào thông minh nhất, mà còn là model nào có thể tự xử lý công việc phức tạp, lâu dài với chi phí hợp lý. Đây có thể là hướng cạnh tranh quan trọng khi AI agent ngày càng được đưa vào các công việc thực tế.
Nguồn:
- x.ai
- artificialanalysis.ai/models/grok-4-6
- artificialanalysis.ai/articles/grok-4-6-benchmarks-and-analysis
Google DeepMind đưa AI ngôn ngữ ký hiệu lên smartphone
Khả năng xử lý ngôn ngữ nói của trí tuệ nhân tạo đã tiến bộ nhanh chóng trong những thập kỷ gần đây, cho phép dịch tự động, đọc chính tả và giao diện đàm thoại dễ sử dụng đối với người nghe bình thường. Tuy nhiên, cuộc cách mạng công nghệ này vẫn chưa tiếp cận được hơn 200 ngôn ngữ ký hiệu trên thế giới — và khoảng 70 triệu người khiếm thính và khó nghe sử dụng chúng.
Google DeepMind vừa giới thiệu SL2T, mô hình AI mới có khả năng chuyển đổi ngôn ngữ ký hiệu thành văn bản theo thời gian thực, đánh dấu lần đầu công nghệ này được đưa vào các sản phẩm dành cho người dùng phổ thông. SL2T hỗ trợ tính năng đọc chính tả từ ngôn ngữ ký hiệu sang văn bản trong Gboard và Live Transcribe trên Pixel 11, bắt đầu với ngôn ngữ ký hiệu của Mỹ (American Sign Language -ASL) sang tiếng Anh, nhiều thiết bị khác sẽ sớm được hỗ trợ và các ngôn ngữ bổ sung sẽ được triển khai sau đó.

Điểm đáng chú ý là SL2T không chỉ là quá trình chuyển đổi ký hiệu thành từ ngữ tuần tự. Ngôn ngữ ký hiệu có ngữ pháp riêng và truyền tải ý nghĩa thông qua các chuyển động đồng thời của bàn tay, cánh tay, cơ thể, khuôn mặt và chuyển động trong không gian. Mô hình được huấn luyện trên hơn 100.000 giờ dữ liệu từ hơn 50 ngôn ngữ ký hiệu, giúp AI có khả năng xử lý đa dạng ngôn ngữ, phương ngữ và trình độ người dùng.
Google cũng thiết kế hệ thống theo hướng bảo vệ quyền riêng tư: camera không gửi video gốc lên máy chủ. Thay vào đó, mô hình trên thiết bị chỉ trích xuất các điểm tọa độ trên cơ thể người dùng, sau đó gửi dữ liệu hình học này để AI thực hiện dịch. Trên benchmark FLEURS-ASL, SL2T đạt 70 BLEURT, cao hơn đáng kể so với các kết quả được công bố trước đó.
Với người dùng, điều này mở ra khả năng sử dụng ngôn ngữ ký hiệu thay vì phải gõ bàn phím khi tìm kiếm, soạn tin nhắn, viết tài liệu hoặc tương tác với Gemini. Google cho biết các thử nghiệm ban đầu cho thấy việc sử dụng ASL để nhập liệu nhanh và tự nhiên hơn so với gõ tiếng Anh. Công nghệ hiện miễn phí trên Pixel 11 và sẽ được mở rộng sang nhiều thiết bị và ngôn ngữ ký hiệu khác trong thời gian tới.
Đây không chỉ là một bước tiến về nhận diện hình ảnh, mà cho thấy AI đang tiến gần hơn tới mục tiêu phá bỏ rào cản giao tiếp và đưa trải nghiệm công nghệ ngang bằng hơn giữa người khiếm thính và người nghe.
Nguồn: deepmind.google
AI kết hợp dữ liệu vệ tinh để dự báo bức xạ mặt trời chi tiết hơn
Một nghiên cứu được trình bày tại KDD 2026 (Knowledge Discovery and Data Mining – Khám phá tri thức và khai phá dữ liệu) giới thiệu Baguan-solar, một hệ thống AI kết hợp mô hình nền tảng thời tiết (weather foundation model) với ảnh vệ tinh địa tĩnh độ phân giải cao để dự báo bức xạ mặt trời trước 24 giờ, ở quy mô không gian đến cấp kilomet.

Điểm đáng chú ý là hệ thống tận dụng ưu thế của hai nguồn dữ liệu: mô hình thời tiết Baguan cung cấp thông tin về các điều kiện khí tượng ở quy mô lớn, trong khi ảnh vệ tinh giúp theo dõi cấu trúc mây ở quy mô chi tiết. Baguan-solar chia quá trình dự báo thành hai giai đoạn: trước tiên dự báo các yếu tố trung gian như độ che phủ mây liên tục cả ngày lẫn đêm, sau đó sử dụng những thông tin này để suy ra bức xạ mặt trời.
Khi đánh giá trên khu vực Đông Á, sử dụng dữ liệu CLDAS (China Meteorological Administration Land Data Assimilation System – Hệ thống đồng hóa dữ liệu bề mặt đất liền của Tổng cục Khí tượng Trung Quốc) làm dữ liệu tham chiếu, Baguan-solar cho kết quả tốt hơn nhiều phương pháp mạnh như ECMWF IFS, Baguan và SolarSeer, với RMSE giảm 16,08%. Hệ thống cũng xử lý tốt hơn những biến động đột ngột của bức xạ do mây gây ra — yếu tố vốn rất khó dự báo chính xác.
Đây không chỉ là kết quả thử nghiệm. Baguan-solar đã được triển khai thực tế để hỗ trợ dự báo điện mặt trời tại một tỉnh ở miền Đông Trung Quốc từ tháng 7/2025, cho thấy tiềm năng đưa các mô hình AI thời tiết và dữ liệu viễn thám vào vận hành hệ thống năng lượng thực tế.
Nguồn:
