HACKOBAR_
ABOUT
AI News Archive
183 items · 50 per page
1
OPSRD Enables On-Policy Self-Distillation Using Expert Role Prompting
10m ago
0.45
2
ArchitectureIQ Benchmark Measures LLM Training Intuition vs Human Experts
10m ago
0.28
3
SpeechConversationBench Evaluates Multi-Turn Reasoning in Speech-to-Speech Models
10m ago
0.40
4
OSWorld-Science Benchmark for Computer-Use Agents in Scientific Workflows
10m ago
0.36
5
BiFE for Efficient CPU-Only Branching Policies via LLMs
41m ago
0.18
6
Framework for Distilling Knowledge in Complex Agentic Systems
41m ago
0.21
7
Spectral Optimization for Controlling Safety Instruction Strength
41m ago
0.24
8
FedLAFP Framework for Personalized Federated Fine-Tuning
41m ago
0.27
9
Last-Chance Policy Identification for Agents Under Resource Depletion
41m ago
0.21
10
OpenAI Agents Escaped Sandboxes via Zero-Day Vulnerabilities
41m ago
0.35
11
SAKI Method Optimizes On-Policy Distillation via Maximal-Coupling-Routed Supervision
1h ago
0.24
12
ARCagent Calibrates Clinical RAG for Conflicting Medical Guidelines
1h ago
0.27
13
Self-Correction Trade-offs in 29 Open-Weight LLMs
1h ago
0.31
14
Attuner Enables Recomputation-Free KV Cache Reuse via Query-Side Adaptation
1h ago
0.34
15
JEV Model Cultural Alignment Shifts with Persona and Language
1h ago
0.21
16
Counterfactual Diagnostics Separate Visual Sensitivity from Claim Persistence in LVLMs
1h ago
0.24
17
HyperZip Uses Diffusion LLMs and Hypernetworks for Faster Compression
1h ago
0.21
18
Identifying Attention Heads Responsible for LLM Sycophancy
1h ago
0.27
19
ContextProgress-Bench Evaluates Progress Reward Models in Long-Horizon Tasks
1h ago
0.18
20
LLM-Guided Pruning Fixes Geometry-Semantic Mismatch in ANN Graphs
1h ago
0.21
21
Factor Analysis of 1,618 Models Reveals Partial Intelligence Interpretability
2h ago
0.18
22
HeurEvo Automates Hybrid Solver-Augmented Heuristics via Co-Evolution
2h ago
0.21
23
LUDI Framework Scales Diffusion Language Models with Per-Token Embeddings
2h ago
0.35
24
RankBuffer Optimizes Open-Ended Generation via Reusable Quality Buffers
2h ago
0.27
25
StateTape Rewrites Coding Agent Context via Repository State Changes
2h ago
0.31
26
FinRT Framework Automates Adversarial Prompt Generation for Finance Models
2h ago
0.31
27
CoRe Framework Mitigates Latent Reward Hacking in Video Diffusion
2h ago
0.28
28
evalstats Tooling Provides Calibrated Statistical Inference for LLM Judges
2h ago
0.24
29
TrustSwap Reveals Source-Trust Shortcuts in Fact-Checking RL Agents
2h ago
0.28
30
OLIVE Distillation Method Improves Reasoning Performance via Teacher Continuations
2h ago
0.35
31
MemFold Optimizes Fixed-Budget Soft Memory for Long-Context Personalization
3h ago
0.31
32
LLMs Suffer Reliability Issues with Non-Canonical Multi-Valued Relations
3h ago
0.21
33
BreakingWeb Benchmarks Browser-Use Agents via Controlled Environment Interventions
3h ago
0.24
34
AdaLCPI Attack Reconstructs Indirect Prompt Injections from Fragments
3h ago
0.35
35
CineSubBench Evaluates Long-Context Multilingual Film Understanding
3h ago
0.18
36
Framework Desktop Preorders Open for AMD Ryzen AI Max 400 Series
3h ago
0.06
37
Dense Retrievers Exhibit Political and Dialect Bias in Query Responses
3h ago
0.35
38
PhenoAIR Uses Multi-Agent Reasoning for Cell Painting MOA Prediction
3h ago
0.24
39
FigAct Transforms Static Scientific Figures Into Interactive Visual Presentations
3h ago
0.31
40
GPT Models Generate More Edit-Inducing Questions Than Human Reviewers
3h ago
0.18
41
ATRI Framework Mitigates LLM Self-Evolution Degeneration via Information Gain
3h ago
0.28
42
Sequential Interfaces and Reasoning Scaffolds Improve LLM Agent Decision-Making
4h ago
0.28
43
Character-Level LSTM Models for Sinhala Sandhi Splitting
4h ago
0.18
44
Lookahead-R Optimizes Tool Retrieval Using Execution-Aware Surrogate World Models
4h ago
0.35
45
Training-Free Human Activity Recognition Fails to Match Supervised Performance
4h ago
0.21
46
Automated Preoperative Screw Planning for Pelvic Fractures
4h ago
0.18
47
ThuRunel Decouples Elicitation and Judgment in Advisory Agents
4h ago
0.28
48
MemEvo Automates Streaming Video Memory Mechanism Discovery
4h ago
0.21
49
Reliable Parallel Decoding for Masked Diffusion Language Models
4h ago
0.25
50
Omni-Decision uses Evidence-Ledger Planning for Multimodal Agents
4h ago
0.54
page 1 / 4
next →