BiG-SURE - Bipartite Graph for Semantic Uncertainty and Reliability Estimation of LLMs
BiG-SURE: black-box uncertainty estimator for LLMs and VLMs using cross-temperature semantic agreement and bipartite anchor-probe graphs.
Search the full wire by company, model, lab, or keyword. Every story we have ever aggregated.
BiG-SURE: black-box uncertainty estimator for LLMs and VLMs using cross-temperature semantic agreement and bipartite anchor-probe graphs.
Action-chunk contrastive RL: extending CRL to multi-step action sequences yields +31.7% offline, +93.1% online gains across benchmarks.
MolLedger: graph neural network with per-atom attributions for ADME property prediction in drug discovery.
Quantum-inspired Grassmann-Plucker token mixing for post-disaster building damage assessment from satellite imagery.
GMTS: gradient magnitude-based token selection improves RL training for LLM reasoning tasks.
REER-PT: framework injecting reasoning annotations into raw pre-training data to improve LLM training efficiency.
Active learning for visual grounding without text annotations using ambiguity detection in referring image segmentation.
Synthetic data security risk: targeted bias injection into aligned LLMs via benign text exploiting subliminal learning.
TaxCE: automated multi-level taxonomy construction from unstructured text with rigorous evaluation framework.
Continued pre-training adapts LLMs to Swedish journalism domain with novel benchmark across six editorial tasks.
Joint embedding and codebook learning for generative e-commerce retrieval to address cascading training errors.
DiffSAC: diffusion model guides robust estimation sampling for consensus-based computer vision tasks.
PLC-DPO corrects mislabeled preference pairs in DPO training by classifying each pair as clean, flip, or tie using policy-reference margin calibration.
CNN-BiLSTM architecture with Bayesian optimization for battery state-of-health estimation in energy systems.
Mechanistic interpretability reveals how roleplay jailbreaks reverse LLM refusals by decomposing persona, scenario, and task elements.
Eye-tracking patterns during naturalistic passage reading predict English second-language proficiency better than traditional linguistic tasks.
Model checking as oracle enables systematic testing of LLM-based policy explainers for faithfulness to underlying decision environments.
Non-collapsible performance metrics in clinical AI can mask fairness disparities across demographic subgroups.
Turing-20B-A2B, a 20B-parameter MoE model with 2B active per token, optimizes latency for physical AI via quantile routing.
Q-Strata hierarchically allocates mixed-precision bitwidths across MoE LLM experts to optimize model-level quantization objectives.
Information geometry framework analyzes how missingness patterns in labels affect efficiency of multiclass classifiers.
AdaPath retrieves query-adaptive meta-paths from biomedical knowledge graphs to enable multi-hop reasoning for LLM QA.
Hierarchical semantic alignment framework for personalized generative retrieval using dynamic query-item mapping and efficient decoding.
Schema-aware multimodal synthesis system for sewing pattern generation from sketches and text descriptions.
Auditable LLM-based computational framework for qualitative thematic analysis with privacy preservation and methodological transparency.
Analysis of pixel-based language model adaptation to low-resource Tibetan using visual script similarity and cross-lingual Brahmic transfer.
Public hyperspectral-XRF dataset of 1,132 rock specimens for mineral identification and elemental composition estimation.
Discrete diffusion language model framework for targeted PDE solver code repair via localized re-masking and infilling.
Interactive mobile "gizmos" are easy to make, hard to share outside Meta's platform.
VLM-browser integration framework enabling deterministic world-model feedback for autonomous self-improving web code generation.